
@madkoding
hace 236 días
Ollama: Tu Puerta de Entrada a la IA Local
¿Cansado de depender de APIs en la nube para usar LLMs? Ollama es la herramienta open-source que permite ejecutar modelos de lenguaje grandes (LLMs) directamente en tu computadora, de forma privada, gratuita y sin conexión a internet. Piensa en ello como "Docker, pero para modelos de IA".
🚀 Instalación Multiplataforma
Windows (10/11)
- Descarga el instalador desde ollama.com
- Ejecuta el
.exey sigue el asistente - Verifica en terminal:
ollama --version
macOS
bash# Opción 1: Descarga directa del sitio web
# Opción 2: Homebrew (recomendado para desarrolladores)
brew install ollama
Linux
bash# Script oficial de instalación
curl -fsSL https://ollama.com/install.sh | sh
# O si prefieres manual (Ubuntu/Debian):
sudo apt install -y ollama
⚙️ Configuración Inicial
Ollama crea automáticamente un directorio en tu sistema:
- Modelos: Se almacenan en
~/.ollama/models(Linux/Mac) oC:\Users\%USERNAME%\.ollama(Windows) - Variables de entorno importantes:
bash# Para cambiar el puerto por defecto (11434) export OLLAMA_HOST=0.0.0.0:8080 # Para forzar uso de CPU (si no tienes GPU) export OLLAMA_NO_GPU=1 # Directorio personalizado (útil en servidores) export OLLAMA_MODELS=/mnt/disk/ollama-models
🖥️ Uso Básico (CLI + API)
Comandos esenciales:
bash# Descargar un modelo
ollama pull llama3.2
# Ejecutar modo chat interactivo
ollama run llama3.2
# Listar modelos instalados
ollama list
# Eliminar para liberar espacio
ollama rm llama3.2
Uso programático (API REST): Ollama expone automáticamente una API local compatible con OpenAI:
bashcurl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Explica qué es la cuántica en 3 líneas",
"stream": false
}'
🧠 Guía de Modelos: Familia Ministral por Caso de Uso
Ministral (desarrollado por Mistral AI) destaca por su eficiencia extrema. Aquí cuándo usar cada variante según tu hardware:
| Modelo | VRAM Requerida* | Casos de Uso Ideales | Dispositivo Típico |
|---|---|---|---|
| Ministral 3B | 2-4 GB | • Chatbots embebidos en apps móviles• Clasificación de texto en tiempo real• Resumen de documentos cortos• Autocompletado de código ligero | Raspberry Pi 5, Laptops integradas (sin GPU dedicada), Edge devices |
| Ministral 8B | 6-8 GB | • Asistente de coding local (VS Code + Continue.dev)• RAG (Retrieval Augmented Generation) para bases de conocimiento medianas• Análisis de documentos técnicos• Chat multiturno contextual | Laptops gaming (GTX 1650/RTX 3050), PCs de gama media |
| Mistral 7B/8x7B | 8-48 GB | • Análisis profundo de código legacy• Generación de documentación técnica compleja• Fine-tuning local con LoRA | RTX 4070/4080, Workstations profesionales |
*Estimaciones basadas en cuantización Q4_K_M (la default de Ollama). Usa --quantize q8_0 para mejor calidad (dobla los requisitos de VRAM).
Ejemplos prácticos de uso:
bash# Para un servidor IoT con 4GB RAM total:
ollama pull ministral:3b
# Para desarrollo en laptop con RTX 3060 (6GB):
ollama run ministral:8b
# Si tienes 16GB VRAM y necesitas calidad premium:
ollama pull mistral:7b-instruct-q8_0
Pro-tip de configuración por modelo:
Crea un Modelfile para optimizar según tu VRAM:
dockerfileFROM ministral:8b
PARAMETER temperature 0.7
PARAMETER num_ctx 4096 # Aumenta contexto si tienes VRAM extra
SYSTEM Eres un experto en optimización de código Python.
🔒 Ventajas Clave de Ollama
- Privacidad absoluta: Tus datos nunca salen de la máquina
- Offline-first: Funciona en aviones o zonas remotas
- Costo cero: Sin límites de tokens ni suscripciones
- Hot-swapping: Cambia entre modelos sin reiniciar
¿Listo para empezar? Con solo 4GB de VRAM ya puedes tener un asistente de IA funcional para tareas diarias, y con 8GB entras en el territorio del "developer power-user".
¿Qué modelo vas a probar primero?

@madkoding
hace 236 días
Ollama: Tu Puerta de Entrada a la IA Local
¿Cansado de depender de APIs en la nube para usar LLMs? Ollama es la herramienta open-source que permite ejecutar modelos de lenguaje grandes (LLMs) directamente en tu computadora, de forma privada, gratuita y sin conexión a internet. Piensa en ello como "Docker, pero para modelos de IA".
🚀 Instalación Multiplataforma
Windows (10/11)
- Descarga el instalador desde ollama.com
- Ejecuta el
.exey sigue el asistente - Verifica en terminal:
ollama --version
macOS
bash# Opción 1: Descarga directa del sitio web
# Opción 2: Homebrew (recomendado para desarrolladores)
brew install ollama
Linux
bash# Script oficial de instalación
curl -fsSL https://ollama.com/install.sh | sh
# O si prefieres manual (Ubuntu/Debian):
sudo apt install -y ollama
⚙️ Configuración Inicial
Ollama crea automáticamente un directorio en tu sistema:
- Modelos: Se almacenan en
~/.ollama/models(Linux/Mac) oC:\Users\%USERNAME%\.ollama(Windows) - Variables de entorno importantes:
bash# Para cambiar el puerto por defecto (11434) export OLLAMA_HOST=0.0.0.0:8080 # Para forzar uso de CPU (si no tienes GPU) export OLLAMA_NO_GPU=1 # Directorio personalizado (útil en servidores) export OLLAMA_MODELS=/mnt/disk/ollama-models
🖥️ Uso Básico (CLI + API)
Comandos esenciales:
bash# Descargar un modelo
ollama pull llama3.2
# Ejecutar modo chat interactivo
ollama run llama3.2
# Listar modelos instalados
ollama list
# Eliminar para liberar espacio
ollama rm llama3.2
Uso programático (API REST): Ollama expone automáticamente una API local compatible con OpenAI:
bashcurl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Explica qué es la cuántica en 3 líneas",
"stream": false
}'
🧠 Guía de Modelos: Familia Ministral por Caso de Uso
Ministral (desarrollado por Mistral AI) destaca por su eficiencia extrema. Aquí cuándo usar cada variante según tu hardware:
| Modelo | VRAM Requerida* | Casos de Uso Ideales | Dispositivo Típico |
|---|---|---|---|
| Ministral 3B | 2-4 GB | • Chatbots embebidos en apps móviles• Clasificación de texto en tiempo real• Resumen de documentos cortos• Autocompletado de código ligero | Raspberry Pi 5, Laptops integradas (sin GPU dedicada), Edge devices |
| Ministral 8B | 6-8 GB | • Asistente de coding local (VS Code + Continue.dev)• RAG (Retrieval Augmented Generation) para bases de conocimiento medianas• Análisis de documentos técnicos• Chat multiturno contextual | Laptops gaming (GTX 1650/RTX 3050), PCs de gama media |
| Mistral 7B/8x7B | 8-48 GB | • Análisis profundo de código legacy• Generación de documentación técnica compleja• Fine-tuning local con LoRA | RTX 4070/4080, Workstations profesionales |
*Estimaciones basadas en cuantización Q4_K_M (la default de Ollama). Usa --quantize q8_0 para mejor calidad (dobla los requisitos de VRAM).
Ejemplos prácticos de uso:
bash# Para un servidor IoT con 4GB RAM total:
ollama pull ministral:3b
# Para desarrollo en laptop con RTX 3060 (6GB):
ollama run ministral:8b
# Si tienes 16GB VRAM y necesitas calidad premium:
ollama pull mistral:7b-instruct-q8_0
Pro-tip de configuración por modelo:
Crea un Modelfile para optimizar según tu VRAM:
dockerfileFROM ministral:8b
PARAMETER temperature 0.7
PARAMETER num_ctx 4096 # Aumenta contexto si tienes VRAM extra
SYSTEM Eres un experto en optimización de código Python.
🔒 Ventajas Clave de Ollama
- Privacidad absoluta: Tus datos nunca salen de la máquina
- Offline-first: Funciona en aviones o zonas remotas
- Costo cero: Sin límites de tokens ni suscripciones
- Hot-swapping: Cambia entre modelos sin reiniciar
¿Listo para empezar? Con solo 4GB de VRAM ya puedes tener un asistente de IA funcional para tareas diarias, y con 8GB entras en el territorio del "developer power-user".
¿Qué modelo vas a probar primero?