Ejecutar un modelo de IA en forma local permite trabajar con código, documentación y proyectos internos sin enviar los prompts a un proveedor externo. En esta guía vamos a instalar Ollama en macOS, descargar Gemma 4 E4B y conectarlo con OpenCode para usar un agente de desarrollo desde la terminal.
El flujo final será: «`text OpenCode → Ollama local → Gemma 4 E4B → Mac
La descarga inicial de las herramientas y del modelo requiere conexión a Internet. Una vez instalados, la inferencia del modelo puede funcionar sin conexión, siempre que no se usen funciones externas como navegación web, APIs cloud o comandos que accedan a Internet.
Requisitos
- macOS con Apple Silicon recomendado.
- Al menos 24 GB de memoria unificada para una experiencia cómoda con Gemma 4 E4B.
- Espacio libre en disco: 15 GB como mínimo.
- Terminal.
- Conexión a Internet durante la instalación.
Gemma 4 E4B ocupa aproximadamente 9,6 GB en Ollama. Es un modelo compacto con soporte para razonamiento, herramientas e imágenes, adecuado para pruebas, automatización simple, YAML, Bash, Terraform y consultas sobre proyectos. Ver modelos Gemma 4 en Ollama
Paso 1: instalar Ollama en macOS
Descargar Ollama para macOS desde su sitio oficial:
https://ollama.com/download/mac
Abrir la aplicación de Ollama una vez instalada. Esto inicia el servicio local que escucha, por defecto, en:
http://localhost:11434
Verificar la instalación desde Terminal:
ollama --version
También se puede verificar que el servicio responda:
ollama list
Si Ollama no responde, abrir la aplicación nuevamente desde Spotlight o desde Aplicaciones.
NOTA: yo lo instale con brew para que sea mas simple que es:
brew install ollama
Para iniciar ollama
brew services start ollama
O para detenerlo
brew services stop ollama
Actualizar con brew
brew update brew upgrade ollama brew services restart ollama
Paso 2: descargar Gemma 4 E4B
Descargar el modelo:
ollama pull gemma4:e4b
Verificar que aparezca instalado:
ollama list
La salida debería mostrar una línea similar a esta:
NAME ID SIZE
gemma4:e4b xxxxxxxxxxxx 9.6 GB
Probar el modelo directamente:
ollama run gemma4:e4b
Por ejemplo:
Explicá qué hace este recurso de Terraform y señalá posibles riesgos.
Para salir de la sesión interactiva, usar:
/bye
Paso 3: instalar OpenCode
OpenCode es un agente open source que trabaja desde la terminal: puede leer archivos del proyecto, proponer o aplicar cambios y ejecutar comandos.
Instalarlo con:
curl -fsSL https://opencode.ai/install | bash
Cerrar y volver a abrir la Terminal. Alternativamente:
exec "$SHELL" -l
Verificar la instalación:
opencode --version
La documentación de OpenCode también ofrece una instalación alternativa mediante npm:
npm install -g opencode-ai
Usar sólo una de las dos opciones.
Paso 4: configurar OpenCode para usar Ollama local
Crear el directorio de configuración si todavía no existe:
mkdir -p ~/.config/opencode
Abrir el archivo de configuración:
nano ~/.config/opencode/opencode.json
Pegar esta configuración:
Pegar esta configuración:
{
"$schema": "https://opencode.ai/config.json",
"model": "ollama/gemma4-e4b-opencode",
"provider": {
"ollama": {
"npm": "@ai-sdk/openai-compatible",
"name": "Ollama local",
"options": {
"baseURL": "http://127.0.0.1:11434/v1",
"apiKey": "ollama",
"timeout": 120000
},
"models": {
"gemma4-e4b-opencode": {
"name": "Gemma 4 E4B local",
"limit": {
"context": 65536,
"output": 4096
}
}
}
}
}
}
Guardar con Control + O, confirmar con Enter y salir con Control + X.
Esta configuración conecta OpenCode con la API compatible con OpenAI que Ollama expone localmente. La documentación oficial de ambos proyectos describe este método de integración. Guía de proveedores de OpenCode y guía de integración de Ollama.
Paso 5: iniciar OpenCode dentro de un proyecto
Ir al directorio de un proyecto:
cd ~/proyectos/mi-proyecto
Iniciar OpenCode:
opencode
Dentro de OpenCode, ejecutar:
/models
Seleccionar:
Ollama local / Gemma 4 E4B local
Como primera prueba, conviene pedirle que sólo analice el proyecto:
Analizá este repositorio sin modificar archivos. Explicá su estructura, tecnologías utilizadas, comandos de ejecución y riesgos técnicos que detectes.
Luego se pueden pedir tareas acotadas:
Revisá los archivos Terraform y detectá variables sin descripción, recursos públicos o configuraciones potencialmente inseguras. No apliques cambios.
Explicá este error de Docker Compose y proponé una corrección. Mostrá primero el diff antes de modificar archivos.
Inicio rápido sin configuración persistente
Ollama puede iniciar OpenCode directamente con el modelo local:
ollama launch opencode --model gemma4:e4b
Este método es práctico para probar la integración. No reemplaza el archivo ~/.config/opencode/opencode.json, por lo que la configuración manual sigue siendo útil cuando se quiere definir un modelo local por defecto.
Probar el funcionamiento sin Internet
Una vez que Ollama, OpenCode y Gemma estén instalados:
- Desconectar Wi-Fi o Ethernet.
- Abrir Terminal.
- Entrar en un proyecto local.
- Ejecutar:
opencode
- Pedir un análisis sobre archivos locales.
Si el modelo responde, la inferencia se está realizando en la Mac sin depender de una API externa.
Consideraciones de seguridad
Que el modelo sea local no significa que todas las acciones sean locales. OpenCode puede ejecutar comandos y las herramientas invocadas pueden acceder a red, credenciales o infraestructura cloud.
Antes de usarlo con AWS, GCP, Kubernetes o Terraform:
- Empezar con repositorios de prueba.
- Pedir análisis y planes antes de permitir cambios.
- Revisar siempre
git diff. - Usar credenciales temporales y de mínimo privilegio.
- Separar perfiles de desarrollo, staging y producción.
- No exponer archivos
.env, tokens, claves privadas o secretos al contexto del agente. - Evitar que ejecute
terraform apply, despliegues o comandos destructivos sin revisión humana.
Conclusión
Con Ollama, Gemma 4 y OpenCode es posible montar un asistente de desarrollo local en macOS sin depender de servicios cloud para la inferencia. Gemma 4 E4B es una buena puerta de entrada por su tamaño moderado y compatibilidad con herramientas.
Para tareas más complejas, repositorios grandes o automatizaciones de mayor autonomía, conviene evaluar modelos especializados en código con más parámetros y memoria disponible. Pero para aprender el flujo, analizar infraestructura y asistir en tareas cotidianas de desarrollo y DevOps, esta combinación ofrece una base privada, práctica y sin costo por token.







