Ollama es una herramienta que te permite ejecutar modelos de inteligencia artificial directamente en tu ordenador, sin enviar tus datos a ningún servidor externo. Esto significa privacidad total, sin coste por uso y funcionamiento incluso sin conexión a internet. En esta guía te explicamos cómo instalarlo, qué modelos elegir según tu hardware y cómo sacarle partido en el día a día.

Qué necesitas para empezar

Ollama funciona en Windows, macOS y Linux. Los requisitos mínimos dependen del modelo que quieras ejecutar. Para modelos pequeños como Phi-3 Mini o Gemma 2B, cualquier ordenador relativamente moderno con 8 GB de RAM sirve. Para modelos medianos como Llama 3 8B o Mistral 7B, necesitas al menos 16 GB de RAM. Y para los modelos grandes como Llama 3 70B, necesitas 64 GB de RAM o una GPU potente.

La buena noticia es que los modelos pequeños y medianos ya son sorprendentemente capaces para la mayoría de tareas cotidianas.

Instalación paso a paso

En macOS y Windows, ve a ollama.com y descarga el instalador. Ejecútalo y sigue las instrucciones. En menos de un minuto está listo.

En Linux, abre una terminal y ejecuta: curl -fsSL https://ollama.com/install.sh | sh. Esto descarga e instala Ollama automáticamente.

Para verificar que funciona, abre una terminal (o PowerShell en Windows) y escribe: ollama --version. Deberías ver el número de versión.

Descargar y ejecutar tu primer modelo

El momento más emocionante. Escribe en la terminal: ollama run llama3.1. La primera vez tardará unos minutos en descargar el modelo (son varios gigabytes). Una vez descargado, se abre un chat interactivo directamente en la terminal.

Puedes empezar a escribir preguntas o instrucciones como harías con ChatGPT. Escribe "Explícame qué es la fotosíntesis de forma sencilla" y verás la respuesta generarse en tiempo real. Para salir, escribe /bye.

Modelos recomendados según tu caso de uso

Para conversación general y preguntas, Llama 3.1 8B es la mejor opción equilibrada. Es rápido, capaz y funciona bien en la mayoría de hardware moderno. Ejecútalo con: ollama run llama3.1.

Para programación y código, CodeGemma o DeepSeek Coder son excelentes. Si necesitas que te ayude a escribir código, corregir errores o explicar funciones, estos modelos están específicamente entrenados para ello. Úsalos con: ollama run codegemma o ollama run deepseek-coder.

Para textos en español, Llama 3.1 funciona bastante bien en español. Mistral también maneja bien el castellano. Si el español es tu prioridad, prueba ambos y quédate con el que mejor se adapte a tu forma de escribir.

Para tareas ligeras y ordenadores modestos, Phi-3 Mini de Microsoft es impresionante para su tamaño. Funciona fluido incluso en portátiles antiguos: ollama run phi3.

Usar Ollama más allá de la terminal

La terminal está bien para probar, pero para uso diario hay opciones más cómodas. Open WebUI es una interfaz web tipo ChatGPT que se conecta a Ollama y te ofrece conversaciones con historial, selección de modelos y una experiencia mucho más agradable. Se instala con Docker: docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway ghcr.io/open-webui/open-webui:main. Después abres localhost:3000 en tu navegador y tienes tu propio ChatGPT privado.

Otra opción es usar extensiones de VS Code como Continue que conectan Ollama con tu editor de código para tener autocompletado inteligente y un asistente de programación sin enviar tu código a ningún servidor externo.

Ollama también expone una API local en el puerto 11434. Esto significa que cualquier aplicación de tu ordenador puede usar los modelos. Si desarrollas software, puedes integrar IA en tus proyectos con una simple llamada HTTP a localhost:11434/api/generate.

Gestionar modelos instalados

Con el tiempo acumularás varios modelos. Para ver los que tienes instalados: ollama list. Para eliminar uno que ya no uses y liberar espacio: ollama rm nombre-del-modelo. Para actualizar un modelo a su última versión: ollama pull nombre-del-modelo.

Los modelos se guardan en tu disco duro. Un modelo de 7B parámetros ocupa entre 4 y 8 GB. Tenlo en cuenta si tu disco está justo de espacio.

Personalizar modelos con Modelfile

Una de las funciones más potentes de Ollama es crear variantes personalizadas de modelos. Creas un archivo llamado Modelfile con instrucciones como:

FROM llama3.1 SYSTEM Eres un asistente especializado en cocina española. Respondes siempre en español con recetas detalladas, tiempos de cocción exactos y sugerencias de maridaje. Tu tono es cercano y entusiasta.

Luego ejecutas: ollama create mi-chef -f Modelfile. Y ya tienes tu propio modelo personalizado que puedes ejecutar con: ollama run mi-chef. Esto es equivalente a las instrucciones personalizadas de ChatGPT, pero ejecutado totalmente en local.

Rendimiento y trucos

Si tienes una GPU Nvidia, Ollama la detecta automáticamente y la usa para acelerar la generación. La diferencia es enorme: un modelo que genera 5 tokens por segundo en CPU puede generar 50 o más en GPU.

Para Mac con chip Apple Silicon (M1, M2, M3, M4), el rendimiento es excelente gracias a la memoria unificada. Ollama aprovecha la GPU integrada sin configuración adicional.

Si notas que las respuestas son lentas, prueba un modelo más pequeño. La diferencia de calidad entre un modelo de 7B y uno de 3B es menor de lo que piensas, y la velocidad mejora drásticamente.