KodingVibes
Volver al inicio
1
Ollama: Tu Puerta de Entrada a la IA Local

@madkoding

hace 236 días

aillmprompt-engineering

Ollama: Tu Puerta de Entrada a la IA Local

¿Cansado de depender de APIs en la nube para usar LLMs? Ollama es la herramienta open-source que permite ejecutar modelos de lenguaje grandes (LLMs) directamente en tu computadora, de forma privada, gratuita y sin conexión a internet. Piensa en ello como "Docker, pero para modelos de IA".


🚀 Instalación Multiplataforma

Windows (10/11)

  1. Descarga el instalador desde ollama.com
  2. Ejecuta el .exe y sigue el asistente
  3. Verifica en terminal: ollama --version

macOS

bash# Opción 1: Descarga directa del sitio web
# Opción 2: Homebrew (recomendado para desarrolladores)
brew install ollama

Linux

bash# Script oficial de instalación
curl -fsSL https://ollama.com/install.sh | sh

# O si prefieres manual (Ubuntu/Debian):
sudo apt install -y ollama

⚙️ Configuración Inicial

Ollama crea automáticamente un directorio en tu sistema:

  • Modelos: Se almacenan en ~/.ollama/models (Linux/Mac) o C:\Users\%USERNAME%\.ollama (Windows)
  • Variables de entorno importantes:
    bash# Para cambiar el puerto por defecto (11434)
    export OLLAMA_HOST=0.0.0.0:8080
    
    # Para forzar uso de CPU (si no tienes GPU)
    export OLLAMA_NO_GPU=1
    
    # Directorio personalizado (útil en servidores)
    export OLLAMA_MODELS=/mnt/disk/ollama-models

🖥️ Uso Básico (CLI + API)

Comandos esenciales:

bash# Descargar un modelo
ollama pull llama3.2

# Ejecutar modo chat interactivo
ollama run llama3.2

# Listar modelos instalados
ollama list

# Eliminar para liberar espacio
ollama rm llama3.2

Uso programático (API REST): Ollama expone automáticamente una API local compatible con OpenAI:

bashcurl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Explica qué es la cuántica en 3 líneas",
  "stream": false
}'

🧠 Guía de Modelos: Familia Ministral por Caso de Uso

Ministral (desarrollado por Mistral AI) destaca por su eficiencia extrema. Aquí cuándo usar cada variante según tu hardware:

ModeloVRAM Requerida*Casos de Uso IdealesDispositivo Típico
Ministral 3B2-4 GB• Chatbots embebidos en apps móviles• Clasificación de texto en tiempo real• Resumen de documentos cortos• Autocompletado de código ligeroRaspberry Pi 5, Laptops integradas (sin GPU dedicada), Edge devices
Ministral 8B6-8 GB• Asistente de coding local (VS Code + Continue.dev)• RAG (Retrieval Augmented Generation) para bases de conocimiento medianas• Análisis de documentos técnicos• Chat multiturno contextualLaptops gaming (GTX 1650/RTX 3050), PCs de gama media
Mistral 7B/8x7B8-48 GB• Análisis profundo de código legacy• Generación de documentación técnica compleja• Fine-tuning local con LoRARTX 4070/4080, Workstations profesionales

*Estimaciones basadas en cuantización Q4_K_M (la default de Ollama). Usa --quantize q8_0 para mejor calidad (dobla los requisitos de VRAM).

Ejemplos prácticos de uso:

bash# Para un servidor IoT con 4GB RAM total:
ollama pull ministral:3b

# Para desarrollo en laptop con RTX 3060 (6GB):
ollama run ministral:8b

# Si tienes 16GB VRAM y necesitas calidad premium:
ollama pull mistral:7b-instruct-q8_0

Pro-tip de configuración por modelo: Crea un Modelfile para optimizar según tu VRAM:

dockerfileFROM ministral:8b
PARAMETER temperature 0.7
PARAMETER num_ctx 4096  # Aumenta contexto si tienes VRAM extra
SYSTEM Eres un experto en optimización de código Python.

🔒 Ventajas Clave de Ollama

  1. Privacidad absoluta: Tus datos nunca salen de la máquina
  2. Offline-first: Funciona en aviones o zonas remotas
  3. Costo cero: Sin límites de tokens ni suscripciones
  4. Hot-swapping: Cambia entre modelos sin reiniciar

¿Listo para empezar? Con solo 4GB de VRAM ya puedes tener un asistente de IA funcional para tareas diarias, y con 8GB entras en el territorio del "developer power-user".

¿Qué modelo vas a probar primero?

Comentarios0

No hay comentarios aún. Sé el primero en comentar.

Inicia sesión para participar en la conversación