Índice
Probablemente das por hecho que un gran modelo de lenguaje (LLM) tiene que ejecutarse en la nube. En realidad, ejecutar la IA por completo dentro de tu propio PC —un "LLM local"— es ya una opción realista. Tus datos nunca salen de la máquina, no hay tarifas de API y funciona sin internet. En 2026, los modelos y las herramientas han avanzado tanto que incluso un portátil corriente resulta genuinamente útil.
Este artículo explica, para principiantes, qué es un LLM local, sus ventajas y desventajas, las specs que necesitas, cómo empezar, modelos recomendados y cuándo usarlo frente a la nube.
Nada se envía a la nube, nada se factura
— tus datos se quedan en la máquina; instálalo una vez y úsalo cuanto quieras
Privacidad
Tu entrada nunca se envía a un servidor externo: seguro incluso para datos confidenciales.
Coste cero
Sin tarifas de API. Instálalo una vez y es gratis sin importar cuánto lo uses.
Sin conexión
Funciona sin internet: en un avión o fuera de casa, sin problema.
1. ¿Qué es un LLM local?
Un LLM local significa ejecutar un modelo de IA como ChatGPT o Claude directamente en tu propio PC (o teléfono) en lugar de en la nube. La IA que usas normalmente envía tu entrada a un servidor lejano, la procesa allí y te devuelve la respuesta; pero un LLM local hace todo ese procesamiento en la máquina que tienes delante.
Piénsalo como "streaming de música vs. descarga". La IA en la nube es como reproducir por la red cada vez que quieres escuchar algo; un LLM local es como descargar la canción a tu dispositivo para poder reproducirla sin conexión, cuando quieras. Una vez que pones un modelo —un archivo de unos pocos gigabytes— en tu PC, puedes ejecutarlo sin internet y sin tarifas.
💡 En una línea: un LLM local es "IA que se ejecuta por completo en tu PC, sin que nada se envíe a la red". Es fuerte en privacidad y coste, pero no tan inteligente como la IA en la nube de primer nivel. Entender ese equilibrio es el primer paso.
2. ¿Por qué local? Ventajas y desventajas
Los LLM locales tienen tres grandes atractivos: privacidad, coste y uso sin conexión. Como la entrada nunca sale de tu máquina, los datos confidenciales son más fáciles de manejar y no hay tarifas de API. De hecho, se han reportado casos de empresas que recortaron drásticamente sus costes de IA al trasladar el trabajo de alto volumen a modelos locales (una empresa habría pasado de 47.000 a 8.000 dólares al mes).
También hay desventajas. Seamos honestos al respecto.
- Los datos nunca salen de tu máquina (privacidad)
- Uso ilimitado sin tarifas adicionales
- Funciona sin internet
- Personaliza modelos y ajustes con libertad
- No tan inteligente como la IA en la nube de primer nivel
- Necesita un PC razonablemente capaz
- Algo de configuración inicial
- Sin conocimiento actualizado (solo hasta su corte de entrenamiento)
En resumen: "un paso por detrás de la vanguardia en inteligencia, pero un claro ganador en privacidad, coste y uso sin conexión". Para los usos en los que puedes aceptar ese equilibrio, un LLM local es una opción potente.
3. Las specs de PC que necesitas y la cuantización
"¿Funcionará en mi PC?" es la gran pregunta. Las claves son la memoria (RAM, o la VRAM de una GPU) y la cuantización.
La cuantización es una técnica de compresión que reduce drásticamente el tamaño de un modelo a cambio de una ligera pérdida de precisión. El estándar es el formato GGUF, y dentro de él "Q4_K_M" es el equilibrio de referencia (mantiene la mayor parte de la calidad a la vez que reduce la memoria a aproximadamente una cuarta parte del original). HuggingFace aloja más de 130.000 modelos GGUF.
Una regla práctica para la memoria, con cuantización de 4 bits, es "unos 0,5 GB por cada mil millones (1B) de parámetros". En forma de tabla:
| Tamaño del modelo | Memoria aprox. (4 bits) | PC más adecuado |
|---|---|---|
| 3B–7B | ~4–8 GB | Un portátil típico (ideal para empezar) |
| 12B–14B | ~8–16 GB | Un PC o Mac con 16 GB o más de memoria |
| 30B–70B | ~20–40 GB+ | Un Mac de mucha memoria o una GPU dedicada |
* Solo una guía; las necesidades reales varían según el modelo, el nivel de cuantización y la longitud del contexto. Los Mac con Apple Silicon (serie M), con "memoria unificada", manejan modelos más grandes con mayor facilidad. Se dice que igualar la inteligencia de un modelo de la nube de clase GPT requiere una GPU con 24 GB o más de VRAM (una tarjeta cara).
Para simplemente probarlo, la clase de 3B–7B es más que suficiente. Los modelos pequeños recientes son notablemente capaces y se ejecutan incluso en un PC con unos 8 GB de memoria.
4. Cómo empezar: dos herramientas
Para profundizar en Ollama, consulta la guía completa de Ollama (comandos, API, personalización).
No se necesitan comandos complicados. Solo elige una de las dos herramientas de referencia según tu perfil.
LM Studio (para principiantes)
Una aplicación de escritorio pulida. Elige un modelo de una lista, descárgalo y chatea de inmediato. No hace falta programar: funciona en una pantalla parecida a la de ChatGPT. Empieza aquí si solo lo estás probando.
Ollama (para desarrolladores)
Una herramienta ligera de línea de comandos (52 millones de descargas mensuales en el Q1 de 2026). Se inicia con una sola línea, ollama run llama3.2. También ofrece una API, ideal para integrarla en tu propia aplicación.
Ambas son gratuitas y funcionan en Windows, Mac y Linux. También hay otras: Jan, Open WebUI, llama.cpp. Para principiantes, instala LM Studio y descarga un modelo pequeño: ese es el primer paso más rápido.
5. Modelos recomendados (2026)
Estos son modelos representativos que se ejecutan en local, por caso de uso. Todos son modelos abiertos (de uso gratuito).
Llama 3.2 (7B)
El punto de partida de referencia. Se ejecuta en un PC de gama media y responde con naturalidad. Si dudas, empieza aquí.
Google Gemma 4
La versión de 12B funciona con 16 GB de memoria e incluso maneja audio. Un equilibrio entre ligereza y rendimiento.
Alibaba Qwen3.5
Fuerte en tareas multilingües y en programación. Incluso la versión grande está diseñada para funcionar en un Mac de 64 GB.
DeepSeek, Mistral, etc.
Populares por su razonamiento y su eficiencia de costes. Un amplio abanico de opciones para elegir según el caso de uso.
Los modelos cambian rápido. El truco es ir paso a paso: "prueba primero un modelo de clase 7B y sube a uno más grande si se queda corto". Igual que al comparar las IA en la nube, la forma de saber si una encaja con tu uso es probarla de verdad.
6. Local vs. nube: cuándo usar cada uno
Para profundizar en las diferencias, la brecha de rendimiento y cómo elegir entre local y nube, consulta nuestro artículo sobre LLM local vs LLM en la nube.
Local y nube no son una disyuntiva: la jugada inteligente en 2026 es repartirlos por función.
- Lo local encaja para: manejar datos confidenciales, tareas de alto volumen o repetitivas, entornos sin conexión y trabajo rutinario en el que quieres mantener bajos los costes.
- La nube encaja para: problemas difíciles que exigen máxima precisión, investigación que necesita información actualizada y programación pesada, donde brillan los modelos de primer nivel como ChatGPT, Claude y Gemini.
Por ejemplo, "haz los borradores, la clasificación y los resúmenes en local y gratis, y envía a la nube solo el pulido final o las partes difíciles" funciona bien. El recorte de costes corporativo mencionado antes se apoyó exactamente en este tipo de reparto.
Resumen
Tres conclusiones sobre los LLM locales.
- Qué es: ejecutar un modelo de IA en tu propio PC. Los datos nunca salen, sin tarifas de API ni límites por estar sin conexión.
- Cómo empezar: LM Studio para principiantes, Ollama para desarrolladores. Empieza con un modelo pequeño de 3B–7B. Ahorra memoria con la cuantización (Q4_K_M).
- Cuándo usarlo: la nube es más inteligente. Usa lo local para trabajo confidencial, de alto volumen y sin conexión, y la nube para problemas difíciles; combinar ambos es lo mejor.
Empieza instalando LM Studio y ejecutando un modelo pequeño. La experiencia de "una IA que habla por completo dentro de tu propio PC" es más refrescante de lo que esperarías. Si quieres entender el mecanismo, consulta también cómo funcionan los LLM.
FAQ
P. ¿Funcionará en un portátil corriente?
R. Con unos 8 GB de memoria, funcionará un modelo pequeño de 3B–7B. Con 16 GB o más, los modelos de clase 12B también van cómodos. La recomendación es empezar pequeño y escalar el tamaño para ajustarlo a tu PC.
P. ¿Es un LLM local más inteligente que ChatGPT?
R. En máxima precisión, las IA en la nube de primer nivel (los modelos de gama alta de ChatGPT y Claude) van por delante. La fuerza de un LLM local no es la inteligencia bruta, sino la privacidad, el coste y el uso sin conexión. Para el propósito adecuado, es más que práctico.
P. ¿Es completamente gratis?
R. Las herramientas y los modelos abiertos son gratuitos, y no hay tarifas de API. Lo único que pagas es la electricidad y, si hace falta, el coste inicial de un PC o una GPU. Cuanto más lo usas, más barata sale cada ejecución.
P. ¿Cuánta calidad se pierde con la cuantización?
R. Con la opción de referencia Q4_K_M, la diferencia apenas se nota en la mayoría de los usos. Mantiene la calidad casi intacta mientras reduce la memoria a aproximadamente una cuarta parte, así que elegir Q4_K_M primero rara vez sale mal.