Montando Un Servidor de IA – Parte I

En el artículo de hoy, voy a enseñaros cómo montar un servidor de IA. Diseñaremos un servidor exclusivamente para uso local, orientado a consultas privadas y gestión de información propia. No se tratará, por tanto, de montar un “PC gaming sobre el que ejecutemos Ollama”, sino un pequeño servidor de IA doméstico, con arquitectura preparada para crecer hacia RAG, análisis documental y agentes locales.

El único hándicap que tendremos, como ya imaginaréis, es el coste del hardware; sobre todo, de la GPU (tarjeta gráfica).

Ollama (para quienes no lo sepáis) es una aplicación de código abierto que te permite descargar, gestionar y ejecutar modelos de inteligencia artificial ya existentes (como pueden ser Llama, Mistral, Qwen o DeepSeek) directamente en tu ordenador, de forma totalmente local y sin depender de internet ni de servidores externos.

Para quienes igualmente no lo sepáis, “RAG”, en IA (Retrieval-Augmented Generation o Generación Aumentada por Recuperación) es una técnica de inteligencia artificial que mejora las respuestas de los modelos de lenguaje (LLM) conectándolos a bases de datos o fuentes de conocimiento externas.

Además, voy a orientarlo hacia el tipo de trabajo que realizo —ciberseguridad, informática forense y documentación técnica— por lo que creo que merece la pena sobredimensionarlo un poco en VRAM, RAM y almacenamiento; quizá no tanto en CPU.

 

En un principio, voy a utilizar estos elementos:

Ubuntu Server 24.04 LTS + NVIDIA + Ollama + Open WebUI + Docker + almacenamiento NVMe dedicado, con una GPU de 32 GB de VRAM como mínimo razonable y, si el presupuesto lo permite, 48–96 GB de VRAM.

Como ya os comenté al principio, quienes estéis al tanto de los costes de la memoria (y del hardware en general) la implementación del servidor no será económica. Es el precio que debemos pagar por la autonomía y la privacidad.

La arquitectura sería:

Open WebUI está específicamente pensado para actuar como capa de interfaz sobre Ollama y puede funcionar completamente localmente.

Como veis, utilizaremos “Open WebUI” un interfaz que está específicamente pensado para actuar como capa de interconexión con Ollama y puede funcionar por completo en un entorno local.

En el próximo artículo, empezaremos explicando, justamente, las características y los componentes de hardware que vamos a necesitar.

0
Modelo Predictivo en IA Para Detección de Elevación de Privilegios Windows

No hay comentarios

Aún no hay comentarios

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *