Cada vez son más las personas que deciden ejecutar un modelo de lenguaje en su propio ordenador en lugar de depender de servicios en la nube como ChatGPT o Claude. La motivación principal suele ser la privacidad: ningún dato sale del equipo, ni siquiera cuando se procesan documentos personales o información sensible. A esto se suma la independencia de la conexión a internet y el control total sobre qué modelo se usa y cómo se configura. La buena noticia es que el proceso ha dejado de ser cosa de expertos en programación. Herramientas como Ollama o LM Studio han simplificado la instalación hasta el punto de que cualquier usuario con un portátil moderno puede tener un asistente de inteligencia artificial funcionando en cuestión de minutos, sin pagar suscripciones ni ceder sus conversaciones a terceros.
Por qué interesa tener un modelo local
El argumento de la privacidad es el que más pesa entre quienes trabajan con contratos, historiales clínicos, notas de investigación o cualquier documento confidencial. Al ejecutar el modelo en local, ningún fragmento de texto abandona el disco duro. Tampoco existe el riesgo de que una API externa registre las conversaciones con fines de entrenamiento. Además, un modelo local sigue funcionando sin conexión, algo útil para quienes trabajan en desplazamientos o en zonas con cobertura limitada. El ahorro económico también entra en juego a largo plazo, ya que se elimina la factura mensual de los servicios de pago por uso. Conviene matizar, eso sí, que la calidad de las respuestas de un modelo local de pocos miles de millones de parámetros no suele igualar a la de los modelos de última generación alojados en servidores potentes.
Requisitos de hardware y elección del modelo
No hace falta una tarjeta gráfica de gama alta para empezar. Los modelos de entre 3.000 y 7.000 millones de parámetros funcionan de forma razonable en una CPU moderna con 16 gigabytes de RAM, aunque la velocidad de generación cae entre dos y cinco veces respecto a un equipo con GPU dedicada. Para modelos de 13.000 millones de parámetros en adelante, una tarjeta gráfica con al menos 12 gigabytes de memoria de vídeo marca una diferencia notable en la fluidez de la conversación. La clave para que un modelo grande quepa en poca memoria es la cuantización, una técnica que reduce la precisión numérica de los pesos del modelo —de 16 bits a 4 bits, por ejemplo— a cambio de una pérdida de calidad casi imperceptible en el uso cotidiano. El formato GGUF se ha convertido en el estándar de facto para distribuir estos modelos cuantizados, tal y como explica esta guía detallada sobre cómo ejecutar un LLM local en trece pasos.
Las herramientas más utilizadas
Ollama se ha consolidado como la puerta de entrada más habitual. Se instala con un solo comando, gestiona la descarga de los modelos y expone una API HTTP compatible con la que luego se pueden conectar aplicaciones externas. Sobre esa base suele instalarse Open WebUI, una interfaz de navegador que imita la experiencia de ChatGPT y añade funciones como el historial de conversaciones o la carga de documentos propios. Otra opción muy extendida es LM Studio, que ofrece una interfaz gráfica de escritorio pensada para quienes prefieren evitar la línea de comandos por completo y buscan gestionar los modelos con una simple ventana de descarga. Quien prefiera trabajar con documentos personales puede añadir un modelo de embeddings, como nomic-embed-text, para construir una base de conocimiento local y realizar búsquedas semánticas sobre sus propios archivos sin depender de ningún servidor externo, un proceso descrito con detalle en este tutorial sobre cómo interactuar con documentos usando un LLM local.
El papel de Ollama como pieza central
Dentro de este ecosistema, Ollama merece un apartado propio porque actúa como el motor que sostiene la mayoría de estos montajes domésticos. Su funcionamiento se basa en un demonio que corre en segundo plano y que carga el modelo en memoria bajo demanda, liberándola cuando no se usa durante un tiempo determinado. Los modelos se descargan desde una biblioteca propia con un simple comando de terminal, similar a como funciona Docker con sus imágenes de contenedores. Esta comparación no es casual: Ollama popularizó precisamente la idea de tratar los modelos de lenguaje como paquetes versionados y reutilizables, lo que ha facilitado que decenas de aplicaciones de terceros —desde extensiones de editores de código hasta asistentes de escritorio— se integren con él mediante su API sin necesidad de reinventar la gestión de modelos. Es compatible con familias abiertas como Llama, Mistral, Gemma o Qwen, y admite ejecutar varios modelos en paralelo si el hardware lo permite, algo que resulta especialmente cómodo para comparar respuestas entre versiones distintas del mismo modelo.
Puesta en marcha y mantenimiento
El proceso típico empieza por instalar Ollama desde su web oficial, disponible para macOS, Linux y Windows. Una vez instalado, se comprueba que el servicio está activo consultando su API local, que por defecto escucha en el puerto 11434. A partir de ahí, basta con descargar un modelo de la biblioteca oficial y ya se puede empezar a conversar desde la terminal o desde una interfaz gráfica conectada. Para quienes planean dejar el sistema funcionando de manera permanente, como un servidor doméstico siempre encendido, conviene configurar el arranque automático del servicio tras un reinicio y probarlo al menos una vez de forma deliberada, en lugar de descubrir el fallo el día que se vaya la luz. Quien busque una introducción más pausada, con ejemplos concretos de preguntas y respuestas generadas por un modelo de tres mil millones de parámetros, puede consultar esta introducción accesible a la ejecución de modelos locales.
Limitaciones que conviene tener presentes
No todo son ventajas. Los modelos pequeños que caben en un portátil de consumo tienden a cometer más errores factuales que los modelos grandes alojados en la nube, un fenómeno conocido como alucinación. Algunos desarrolladores defienden que precisamente por eso merece la pena usarlos: acostumbran al usuario a verificar la información en lugar de confiar ciegamente en cualquier respuesta generada por una máquina. También hay que tener en cuenta el consumo energético y el desgaste del hardware cuando se mantienen cargas de trabajo intensivas durante horas, algo relevante para quienes ya tienen un servidor doméstico con varios servicios corriendo de forma simultánea. Por último, la curva de aprendizaje para ajustar parámetros como el tamaño de contexto, la temperatura de generación o el solapamiento de fragmentos en tareas de búsqueda documental sigue existiendo, aunque las interfaces actuales la han suavizado considerablemente respecto a hace apenas dos años.
Reflexiones finales
Lo que hace unos años exigía compilar código a mano y ajustar dependencias de Python por ensayo y error hoy se resuelve con un instalador y un par de comandos de terminal. Esa democratización del acceso a modelos de lenguaje propios abre la puerta a usos muy distintos: desde el profesional que no puede permitirse enviar datos de clientes a un servidor externo, hasta el aficionado que simplemente quiere entender cómo funciona esta tecnología por dentro sin pagar ninguna suscripción. La tendencia apunta a que la brecha de calidad entre los modelos locales y los modelos en la nube seguirá reduciéndose a medida que las técnicas de cuantización y los formatos de distribución maduren. Montar un asistente propio en casa ya no es un capricho técnico, sino una alternativa razonable para quien valore el control sobre sus propios datos por encima de la comodidad de un servicio ya preparado.
2
