Índice
- 1. Qué ha cambiado: los modelos abiertos ya llegan al uso de tipo agente
- 2. Hay dos clases de herramienta: Continue y Cline no son lo mismo
- 3. La primera trampa: la longitud de contexto la decide tu VRAM
- 4. Elegir modelo: la respuesta realista según tu VRAM
- 5. Puesta en marcha: el camino más corto
- 6. La distancia con la nube se ha vuelto difícil de medir
- 7. ¿Es verdad que lo local sale gratis?
- 8. Conclusión: cuándo usar cada uno
- Resumen
- Preguntas frecuentes
Hacer que un modelo que corre en tu propio PC escriba código. Eso ya era posible hace años, pero lo que era posible se limitaba al autocompletado: rellenar la continuación de una línea a medio escribir. El uso de tipo agente, "lee el repositorio, corrige varios archivos y ejecuta los tests", era demasiado pesado para una máquina local.
Eso se movió entre finales de 2025 y 2026. Este artículo ordena, solo con fuentes primarias, hasta dónde se llega hoy de verdad y dónde te vas a atascar. Empezando por la conclusión: funciona, pero hay un peaje, y es que si no cambias un ajuste, se rompe en silencio.
📌 Sobre las cifras de este artículo: los benchmarks y las especificaciones de los modelos salen todos de anuncios de sus desarrolladores (Mistral AI oficial, tarjetas de modelo oficiales de Qwen, documentación oficial de Ollama, documentación oficial de Cline y Anthropic oficial). No se ha usado ningún dato citado de segunda mano en artículos recopilatorios: al documentarme encontré varios casos en los que un recopilatorio atribuía la puntuación de un modelo a otro de tamaño distinto.
1. Qué ha cambiado: los modelos abiertos ya llegan al uso de tipo agente
Lo que muestra el cambio con más claridad es que los propios desarrolladores de los modelos han empezado a vender la "programación de tipo agente" como argumento.
La tarjeta de modelo oficial de Qwen dice que "admite la mayoría de plataformas, como Qwen Code o CLINE, y cuenta con un formato de function call diseñado a medida": menciona por su nombre a extensiones de editor concretas (Qwen3-Coder-30B-A3B-Instruct model card). Es decir, el modelo está construido pensando en agentes de programación concretos.
Mistral AI va en la misma dirección. Devstral 2, anunciado el 9 de diciembre de 2025, es un modelo dedicado que declara explícitamente la "programación de tipo agente", y la variante pequeña, Devstral Small 2 (24B), se publicó bajo Apache 2.0 (Introducing: Devstral 2 and Mistral Vibe CLI).
Cuando solo había autocompletado
Rellenar la continuación de una línea a medias. Basta con un modelo pequeño y el contexto puede ser corto. En local funcionaba sin forzar nada
Al pasar al tipo agente
Hace falta emitir llamadas a herramientas con precisión y sostener un contexto largo. Ya hay modelos abiertos que llegan ahí
2. Hay dos clases de herramienta: Continue y Cline no son lo mismo
Si empiezas confundiendo esto, el resultado no se parecerá a lo que esperabas. Ambas son extensiones de VS Code y ambas se conectan a Ollama, pero su filosofía de diseño es completamente distinta.
| Continue | Cline | |
|---|---|---|
| Carácter | Un surtido de autocompletado, chat y edición | Un agente de programación que actúa de forma autónoma |
| Reparto de papeles | Asigna un modelo distinto a cada papel: chat / edit / apply / rerank / autocomplete |
Un solo modelo va de la planificación a la ejecución |
| Requisitos de hardware | Bajos. Para el autocompletado basta un modelo de unos pocos GB | Altos. Necesita contexto largo y llamadas a herramientas precisas |
| Uso al que se presta | Ir más rápido mientras escribes | Delegar tareas enteras |
Ese diseño de Continue, "un modelo por papel", encaja bien con lo local. Puedes repartir: un modelo pequeño y rápido para el autocompletado y uno grande para el chat. La guía oficial de Ollama también cita por su nombre modelos ligeros como qwen2.5-coder:1.5b o starcoder2:3b para el autocompletado (Continue — Ollama guide).
⚠️ Eso sí, los modelos recomendados en la documentación oficial a veces están anticuados. Para el chat, esa guía propone llama3.1:8b o deepseek-r1:32b, que son de una generación bastante anterior a lo que hoy puedes elegir. Los pasos de la documentación siguen sirviendo, pero conviene no tragarse los nombres de modelo tal cual y volver a elegir en el apartado "4. Elegir modelo".
3. La primera trampa: la longitud de contexto la decide tu VRAM
Este es el apartado más importante del artículo. Si no lo conoces, acabas en la situación de "la instalación fue bien, pero el agente empieza a comportarse de forma incomprensible a mitad de camino". Y encima no aparece ningún error.
La causa está en la longitud de contexto por defecto de Ollama. No es un valor fijo: se decide automáticamente según la cantidad de VRAM (Ollama — Context length).
| VRAM | Longitud de contexto por defecto |
|---|---|
| Menos de 24 GiB | 4k |
| De 24 a 48 GiB | 32k |
| 48 GiB o más | 256k |
Un PC gaming corriente (8 a 16 GB de VRAM) cae en la primera fila. Es decir, 4k. El agente supera esa cifra sin esfuerzo entre el prompt de sistema, el contenido de los archivos y las idas y venidas de las llamadas a herramientas, así que la conversación se va recortando en silencio por el principio. Olvida instrucciones, repite la misma operación, pierde de vista el objetivo a mitad de camino: la causa no es que el modelo sea tonto, sino que el contexto se tira a la basura en la puerta de entrada.
La documentación oficial de Ollama lo dice claro para este caso de uso: "para trabajos exigentes como la búsqueda web o las herramientas de programación, configura el contexto en al menos 64000 tokens". El ajuste se hace con una variable de entorno al arrancar el servidor.
OLLAMA_CONTEXT_LENGTH=64000 ollama serve
Si usas la versión de escritorio, también puedes cambiarlo con el deslizador de la pantalla de ajustes.
⚠️ Pero no basta con estirarlo y ya está. La propia documentación advierte de que "aumentar la longitud de contexto incrementa la memoria necesaria para ejecutar el modelo".
Cuando deja de caber en la VRAM, una parte del modelo se desplaza a la CPU y todo se vuelve dramáticamente más lento. Para comprobar si de verdad está surtiendo efecto, usa ollama ps: así lo indica la documentación oficial. Ahí ves si el modelo ha entrado entero en la GPU.
Del lado de Cline también hay remedios para el mismo problema. Su documentación oficial recomienda "activar Use Compact Prompt" y "acotar la tarea (cuanto menor sea el contexto, más rápida la respuesta)" (Cline — Running models locally). Como el propio prompt de sistema del agente es largo, han previsto un ajuste para encogerlo.
4. Elegir modelo: la respuesta realista según tu VRAM
Mejor no fiarse de las recomendaciones de los artículos recopilatorios. En lo que revisé había textos que proponían modelos de mediados de 2025 como "lo recomendable en 2026", y alguno que ponía la puntuación de un modelo de 480B en la casilla de uno de 30B. Aquí solo alineo lo publicado por los desarrolladores.
| Modelo | Tamaño | Contexto | Licencia | SWE-bench Verified |
|---|---|---|---|---|
| Qwen3.6-35B-A3B | 35B (3B activos) | 262,144 (máximo 1,010,000) | Apache 2.0 | 73.4 |
| Devstral Small 2 | 24B | 256K | Apache 2.0 | 68.0% |
| Devstral 2 (referencia, demasiado grande) | 123B | 256K | Modified MIT | 72.2% |
Fuentes: tarjeta de modelo de Qwen3.6-35B-A3B (Terminal-Bench 2.0: 51.5; QwenClawBench: 52.6) / anuncio oficial de Mistral AI (9 de diciembre de 2025). Las puntuaciones las midió cada empresa por su cuenta; no hay una medición comparativa de terceros.
Lo llamativo de Qwen3.6-35B-A3B son sus "3B activos". De los 35B, lo que realmente se activa en cada pasada equivale a 3B, y ahí es donde luce el MoE (Mixture of Experts). Es una estructura que busca a la vez la inteligencia de un modelo grande y la velocidad de uno pequeño, un diseño que va bien para lo local.
Tamaño de descarga y requisitos
En la biblioteca de Ollama, qwen3.6 ofrece 27b (18GB) y 35b (23GB). También hay etiquetas con -mlx para Mac.
La orientación de memoria que da la documentación oficial de Cline es esta: de 16 a 32GB para modelos pequeños, de 32 a 64GB para modelos de programación de tamaño medio y 64GB o más para modelos grandes con contextos mayores.
VRAM de 8 a 12GB
Limítate al autocompletado con Continue. Renuncia al tipo agente o combínalo con la nube
VRAM de 16 a 24GB
Devstral Small 2 (24B) entra en tu alcance. Como necesitas margen para estirar el contexto, la cuantización es obligatoria
VRAM de 24GB o más / memoria unificada de 32GB o más
Qwen3.6 en 27b/35b es realista. Además el contexto por defecto sube a 32k
Mistral escribe que Devstral Small 2 "funciona en GPU de consumo e incluso en configuraciones solo con CPU". Aun así conviene tener presente que "funciona" y "funciona a una velocidad práctica para un agente" son cosas distintas.
5. Puesta en marcha: el camino más corto
1. Instala Ollama y configura el contexto
El orden importa. Decide la longitud de contexto antes de descargar el modelo.
OLLAMA_CONTEXT_LENGTH=64000 ollama serve
El procedimiento de instalación en sí lo tratamos en la guía completa de Ollama, así que consúltala allí.
2. Descarga el modelo
ollama pull qwen3.6:27b
Si vas justo de VRAM, elige Devstral Small 2. Que ambos estén construidos pensando en el uso de tipo agente es lo que los separa de un modelo de chat generalista.
3. Comprueba que está cargado en la GPU
ollama ps
No te saltes esta comprobación. Si el modelo ha sido desplazado a la CPU, la sensación de uso es otra por completo. Buena parte de los "los LLM locales son demasiado lentos para trabajar" tienen aquí su verdadera causa.
4. Conecta la extensión
Tanto en Cline como en Continue se elige Ollama como proveedor y se indica http://localhost:11434. El aviso de la documentación oficial de Cline es de lo más sencillo, "asegúrate de que Ollama está en marcha antes de enviar un prompt", y no hace falta ninguna configuración especial.
Si usas Cline, activa además Use Compact Prompt.
6. La distancia con la nube se ha vuelto difícil de medir
Prefiero decirlo con franqueza. La comparación del tipo "los modelos locales ya están al X% de la nube" hoy no se puede hacer con limpieza. El motivo es que los benchmarks han dejado de coincidir.
Los modelos abiertos publican SWE-bench Verified. Qwen3.6-35B-A3B saca 73.4 y Devstral Small 2, 68.0%. La frontera, en cambio, se está alejando de ese indicador.
De hecho, en el anuncio de Claude Opus 5 de Anthropic no aparece ninguna cifra de SWE-bench Verified. Lo que se cita es Frontier-Bench v0.1, CursorBench 3.2, AA Coding Agent Index y FrontierCode 1.1, y encima con formulaciones relativas más que valores absolutos ("más del doble del rendimiento de Opus 4.8", "dentro del 0.5% de la puntuación máxima de Fable 5", entre otras).
⚠️ Por eso, cuando veas un "lo local está al X% de Claude", desconfía. Es muy probable que el punto de partida y el de llegada no se hayan medido con el mismo indicador, o que la comparación sea con un Claude de hace varias generaciones. Hoy, con SWE-bench Verified solo se pueden alinear modelos abiertos entre sí.
Las diferencias que aun así se pueden afirmar
Aunque las cifras no cuadren, los puntos donde la diferencia aparece por estructura están claros.
Donde gana lo local
El código no sale de tu máquina / no hay pago por uso (puedes repetir sin contar las veces) / funciona sin conexión / no hay límites de tasa
Donde gana la nube
Razonamiento que abarca varios archivos / estabilidad en ejecuciones autónomas largas / no exige inversión inicial / el modelo se renueva solo
Hay un motivo para que la diferencia se note sobre todo en el "razonamiento que abarca varios archivos". Es la fase que consume contexto a raudales y encadena decenas de decisiones. La diferencia de precisión en una sola decisión se multiplica en cada ida y vuelta. Lo que en un retoque de un único archivo no se nota, en trabajo a escala de repositorio se convierte en algo palpable.
7. ¿Es verdad que lo local sale gratis?
Es cierto que no llega ninguna factura de API, pero gratis no es. Solo ha cambiado la forma del coste.
| Concepto | Local | Nube |
|---|---|---|
| Coste inicial | GPU con mucha VRAM / memoria unificada de gran capacidad | Ninguno |
| Coste que crece con el uso | Solo la electricidad | Pago por tokens o tarifa plana |
| Coste poco visible | El esfuerzo de configurar y mantener, más seguir el ritmo de las actualizaciones de modelos | Ninguno (lo asume el proveedor) |
Por eso "cuál sale más barato" se invierte según las condiciones que compares. Si ya tienes una GPU de la clase de 24GB, lo local funciona con un coste adicional casi nulo. Si no la tienes, con lo que cuesta esa GPU pagas años de suscripción. Es más exacto pensar que la respuesta depende de dos cosas: si vas a lanzar muchísimas ejecuciones a diario y si ya tienes el equipo.
8. Conclusión: cuándo usar cada uno
Motivos válidos para elegir lo local
El código no puede salir (contratos, normativa interna) / ya tienes el equipo / quieres experimentar sin contar las ejecuciones / trabajas sin conexión
Motivos que no lo son
"Porque es gratis" (no has contado el equipo) / "Porque parece rápido" (la nube suele ser más rápida)
Lo más realista es combinar ambos. Deja el autocompletado de Continue en manos de un modelo local pequeño y tenlo corriendo siempre, y entrega los trabajos de cierto volumen al agente en la nube. El autocompletado se invoca muchas veces y cada llamada es ligera, así que va bien en local; el agente se invoca pocas veces y cada llamada es pesada, así que va bien en la nube: la forma de la carga es justo la contraria.
Resumen
- Los modelos abiertos ya llegan a la programación de tipo agente. Tanto Qwen como Mistral publican modelos dedicados que nombran extensiones de editor
- El mayor escollo es la longitud de contexto por defecto de Ollama. Con menos de 24 GiB de VRAM son 4k, y el agente se rompe en silencio. La recomendación oficial es 64000 o más para programar
- Si la estiras, comprueba con
ollama psque el modelo está en la GPU. Desplazado a la CPU, la lentitud es de otra categoría - Continue y Cline no son lo mismo. La primera es de autocompletado y asigna un modelo por papel; la segunda es un agente autónomo. Sus requisitos difieren
- La comparación "el X% de la nube" cada vez se sostiene menos. La frontera está dejando de publicar SWE-bench Verified
- No es "gratis", es "otra forma de coste". La respuesta se invierte según si ya tienes el equipo
Preguntas frecuentes
P1. ¿Puedo usar el tipo agente con una GPU de 8GB de VRAM?
Va a costar. Aunque el modelo quepa, no queda margen para estirar el contexto. El valor por defecto de Ollama pasa a 4k con menos de 24 GiB de VRAM, y llevarlo a 64000 aumenta la memoria necesaria: con 8GB es difícil compaginar ambas cosas. Lo realista es limitarse al autocompletado con Continue o combinar, dejando solo el autocompletado en local y el agente en la nube.
P2. ¿Por cuál debería empezar, Cline o Continue?
Si es tu primer contacto con los LLM locales, por Continue. Sus requisitos son más bajos y aislar el problema cuando algo no funciona resulta más sencillo. Si pasas al tipo agente después de confirmar que el autocompletado va cómodo, podrás separar si el problema es el modelo o la configuración.
P3. ¿Funciona también en Mac?
Sí. Como la memoria unificada se aprovecha directamente como si fuera VRAM, hasta resulta más fácil cargar modelos grandes. La biblioteca de Ollama incluye además etiquetas con -mlx de qwen3.6 (para Apple Silicon). Eso sí, la regla de que el valor por defecto de la longitud de contexto lo decide la memoria se aplica igual, así que hay que comprobarlo.
P4. ¿Qué modelo es "el más inteligente"?
Si solo miramos las puntuaciones publicadas, de los citados aquí el más alto es Qwen3.6-35B-A3B con 73.4 en SWE-bench Verified. Pero se trata de mediciones hechas por cada empresa, no de una comparativa de terceros. En el trabajo real pesan más la licencia (Devstral Small 2 y Qwen3.6 son ambos Apache 2.0) y si el modelo cabe en la VRAM que tienes.
P5. ¿Por qué "se rompe sin dar error"?
Porque lo que excede la longitud de contexto se trata como un recorte y no como un error. El modelo responde con normalidad dentro del "rango que le han pasado". El resultado se manifiesta como olvidar instrucciones, repetir la misma operación y perder de vista el objetivo, y parece falta de capacidad del modelo. Saber que es un síntoma que debe hacerte sospechar de la configuración cambia por completo la rapidez con la que aíslas el fallo.
P6. ¿Qué cuantización elijo?
Si dudas, lo prudente es empezar por el equivalente a Q4_K_M. Las diferencias entre formatos (GGUF / GPTQ / AWQ) y cómo elegir están reunidas en la guía completa de formatos de cuantización. Para programar suele ser más estable "un modelo algo más pequeño con una cuantización más suave" que "un modelo más grande cuantizado con dureza", porque hay que respetar con precisión el formato de las llamadas a herramientas.
P7. ¿Puedo usarlo con el código de mi empresa?
Mientras todo se resuelva en local, el código no sale de tu máquina: esa es la mayor ventaja de un LLM local. Pero revisa la configuración de la extensión. Aunque apuntes el proveedor a Ollama, la telemetría u otras funciones pueden comunicarse con el exterior. Y "si la normativa lo permite" es un asunto distinto del técnico, así que consulta antes las normas internas de tu organización.
Artículos relacionados
- Guía completa de Ollama: instalación y comandos básicos
- Comparativa a fondo de los mejores modelos LLM locales: cómo elegir por uso y tamaño
- Requisitos de PC para LLM locales: referencia rápida de VRAM y GPU
- Guía completa de formatos de cuantización: cómo elegir entre GGUF, GPTQ y AWQ
- Diferencias entre LLM locales y LLM en la nube: rendimiento y criterios de elección