Índice
- 1. Qué es Kimi K3: especificaciones clave y la empresa que lo firma
- 2. Qué significa de verdad el «tercer puesto»: en qué ranking y en qué fecha
- 3. Quién midió cada benchmark: cifras del fabricante frente a cifras de terceros
- 4. Precio: el veredicto se invierte según con qué lo compares
- 5. Todavía nadie puede descargarlo: en qué punto están los pesos abiertos
- 6. Cuánto cayó la bolsa estadounidense: las cifras cambian según el medio
- 7. La acusación de destilación y la réplica
- 8. Puntos débiles: velocidad, alucinaciones y la autocrítica de Moonshot
- 9. Cómo probarlo hoy mismo
- 10. Las afirmaciones, ordenadas por nivel de certeza
- Preguntas frecuentes
El 16 de julio de 2026, la china Moonshot AI lanzó Kimi K3. Con 2,8 billones de parámetros totales se presenta como el mayor modelo abierto jamás anunciado y, a los pocos días del lanzamiento, las acciones de semiconductores estadounidenses sufrían ventas masivas mientras un alto cargo de la Casa Blanca acusaba públicamente a la empresa de destilar los modelos de Anthropic.
El problema es que las cifras, e incluso las etiquetas, no coinciden según quién las publique. Este artículo contrasta a quienes publican los benchmarks, a la prensa financiera, los anuncios de la propia Moonshot y la página real de Hugging Face, e indica sobre la marcha quién produjo cada número.
57 puntos y tercer puesto en Artificial Analysis el día del lanzamiento. Primero en la Frontend Code Arena de Arena.ai. En conjunto, sin embargo, no llega ni a Fable 5 ni a GPT-5.6 Sol.
A $3 de entrada y $15 de salida es claramente más barato que Opus 4.8 o GPT-5.6 Sol. Pero es el más caro de los modelos chinos: el triple que GLM-5.2.
La publicación está prevista para el 27 de julio. Al cierre de este artículo, Hugging Face sigue mostrando una cuenta atrás y la licencia no se ha anunciado.
1. Qué es Kimi K3: especificaciones clave y la empresa que lo firma
Kimi K3 es el modelo insignia de Moonshot AI y su API entró en servicio el 16 de julio de 2026 (dato coincidente en ITmedia NEWS, OpenRouter y otros). La empresa se fundó en 2023, está respaldada por Alibaba y Tencent y, según Forbes, su última ronda de financiación situó su valoración por encima de los 20.000 millones de dólares (venía de 4.300 millones y después 10.000 millones), con unos ingresos recurrentes anuales de 200 millones de dólares en abril de 2026.
Fuentes: el anuncio de Moonshot AI (recogido por ITmedia NEWS, que cita el análisis de npaka) y el artículo práctico de Northflank. La longitud de contexto y el tamaño de los pesos son mediciones de Northflank.
Dos añadidos de arquitectura tienen nombre propio. Kimi Delta Attention (KDA) acelera la decodificación con contextos de un millón de tokens; AINews lo cifra en hasta 6,3 veces más rápido. Y Attention Residuals (AttnRes) recupera de forma selectiva las representaciones que necesita de capas anteriores; el mismo artículo sitúa la mejora en torno a un 25 % más de eficiencia de entrenamiento por menos de un 2 % de coste añadido. Los pesos son MXFP4 y las activaciones MXFP8 y, en lugar de aplicar la cuantización a posteriori, el entrenamiento se ejecutó con la cuantización incorporada desde la fase de SFT en adelante.
🟡 No hay cifra oficial de parámetros activos. Circula la notación «2.8T-A50B» (unos 50.000 millones activos), pero es una estimación derivada de la proporción 16/896, no un dato publicado por Moonshot: Northflank señala explícitamente que la empresa nunca ha declarado el número de parámetros activos. Conviene recordar además que ni OpenAI ni Anthropic revelan el recuento de parámetros de sus propios modelos, así que lo de «2,8 billones, el mayor del mundo» solo se sostiene entre los modelos cuyo tamaño es público.
2. Qué significa de verdad el «tercer puesto»: en qué ranking y en qué fecha
Decir que ocupa el «tercer puesto, por detrás de los últimos modelos de OpenAI y Anthropic» es correcto a grandes rasgos. Pero si no se concreta la fuente, más adelante las cifras dejan de cuadrar.
La base es el Intelligence Index de Artificial Analysis. En su análisis del 17 de julio de 2026, la firma puntuó a Kimi K3 con 57 puntos, lo situó tercero por detrás de Claude Fable 5 y GPT-5.6 Sol, y calificó su inteligencia a la altura de Opus 4.8 y GPT-5.5. Como referencia, el mismo índice da 51 a GLM-5.2 y 44 a DeepSeek v4 Pro.
⚠️ Los mismos 57 puntos se publican como 3.º, 4.º y 7.º
El anuncio de la propia Artificial Analysis dice tercero, el recuento de Northflank dice cuarto de 189 modelos y la página en vivo de la firma muestra séptimo de 190. La puntuación (57) nunca cambió, así que la diferencia viene de qué se incluye en la comparación —si las variantes con distinto nivel de esfuerzo de razonamiento cuentan por separado— y de cuándo se hizo el recuento. Los rankings se mueven a diario, y ese «tercero» se lee mejor como una foto fija fechada el 17 de julio de 2026.
En las métricas más próximas al trabajo real, el orden se afina. Estos son los datos de GDPval-AA v2 de Artificial Analysis, que puntúa tareas prácticas en escala Elo con la referencia humana fijada en 1.000.
| Modelo | GDPval-AA v2 (Elo) | Dónde queda |
|---|---|---|
| Claude Fable 5 | 1760 | 1.º |
| Kimi K3 | 1668 | Por detrás de Fable 5 y Sol |
| Claude Opus 4.8 | 1600 | K3 lo supera |
| GLM-5.2 | 1514 | El mejor de la generación china anterior |
| GPT-5.5 | 1494 | — |
| Kimi K2.6 (generación anterior) | 1190 | K3 está 478 puntos por encima |
Fuente: Artificial Analysis (artículo de la firma publicado el 17 de julio de 2026). En AA-Briefcase, su evaluación agéntica privada, K3 también queda segundo por detrás de Fable 5 con 1547 de Elo, 732 puntos más que el K2.6 de la generación anterior. En AutomationBench-AA se lleva el primer puesto con un 53 %.
La cifra que de verdad importa no es el «tercer puesto», sino el tamaño del salto respecto a la generación anterior. De 1190 a 1668 en GDPval-AA v2, y +732 puntos en AA-Briefcase. Lo que movió al mercado fue constatar que un modelo abierto chino se había puesto a tiro de la frontera estadounidense en una sola generación.
3. Quién midió cada benchmark: cifras del fabricante frente a cifras de terceros
Las cifras de benchmark pesan de forma muy distinta según las haya medido la propia Moonshot o un tercero. ITmedia las presentó por separado, y este artículo sigue la misma práctica.
- Program Bench: K3 77,8 % (GPT-5.6 Sol 77,6 %, Fable 5 76,8 %)
- SWE Marathon: K3 42,0 % (segundo, Opus 4.8 con 40,0 %)
- BrowseComp: K3 91,2 % (GPT-5.6 Sol 90,4 %)
Todas las victorias son por muy poco y todas salen de las pruebas del propio fabricante: conviene leerlas con esa reserva.
- Frontend Code Arena (Arena.ai): K3 primero con 1679 (Fable 5 1631, GPT-5.6 Sol 1618). Lidera seis de los siete subdominios y sube 17 puestos desde el 18.º que ocupaba K2.6
- GDPval-AA v2: K3 tercero con 1668 (Artificial Analysis)
- FrontierSWE: Fable 5 86,6 % > K3 81,2 % ← aquí K3 pierde
- Vals Index: 74,70 % (segundo de 38 modelos, según el recuento de Northflank)
El resultado que merece atención es que queda 5,4 puntos por detrás de Fable 5 en FrontierSWE. Los titulares sobre encabezar ciertos benchmarks son exactos, pero no gana en todos los frentes. La propia Moonshot admite que en conjunto se queda por debajo de Fable 5 y GPT-5.6 Sol (más sobre esto abajo).
🟡 El método de puntuación ha sido cuestionado. El autor de Program Bench señaló que Moonshot usó una tasa media de implementación en lugar del número de programas que llegaron a ejecutarse por completo. La emprendedora del sector Bindu Reddy ha defendido por su parte que hace falta verificación en evaluaciones privadas no contaminadas, como LiveBench. Las victorias ajustadas declaradas por el fabricante deben descontarse en consecuencia.
4. Precio: el veredicto se invierte según con qué lo compares
Kimi K3 cuesta $3,00 de entrada y $15,00 de salida por millón de tokens ($0,30 la entrada en caché). Como la valoración se invierte por completo según la comparación, mirar solo un lado lleva a la conclusión equivocada.
- Kimi K3: $3 / $15
- Claude Opus 4.8: $5 / $25
- GPT-5.6 Sol: $5 / $30
Un 40 % más barato en entrada y entre un 40 % y un 50 % más barato en salida. Rendimiento de nivel frontera por debajo de los precios occidentales ha sido siempre el argumento de Kimi y, en este punto, se sostiene.
- Kimi K3: $3 / $15
- GLM-5.2: alrededor de un tercio del coste por tarea de K3
- DeepSeek V4 Pro: alrededor de una veintitresava parte del coste por tarea de K3
Simon Willison, que habla de una subida fuerte respecto a los modelos anteriores de la empresa, lo describe como el modelo más caro que ha lanzado ningún laboratorio de IA chino.
Conviene dejar algo claro: esto no es otro shock DeepSeek. Lo que hizo tan brusco el episodio de DeepSeek en enero de 2025 fue un precio un orden de magnitud por debajo del occidental. K3 es entre un 40 % y un 50 % más barato que los modelos occidentales, pero en el mismo orden de magnitud. Esto no es disrupción de precios, es rendimiento que se pone al día, con un descuento moderado.
Y lo que acabas pagando no lo fija solo la tarifa por token. Artificial Analysis midió el coste real de completar una tarea mientras ejecutaba su Intelligence Index.
Coste por tarea medido por Artificial Analysis (durante la ejecución de su Intelligence Index)
Fuente: Artificial Analysis. En sus mediciones, Kimi K3 necesitó unos 132 millones de tokens de salida para completar el Intelligence Index, menos que los aproximadamente 166 millones que consumió el K2.6 de la generación anterior. La tarifa es más alta, pero un razonamiento menos verboso rebaja el total.
Más barato que Opus 4.8 tanto en tarifa de catálogo como en coste medido, y el más caro de los modelos chinos: esa es la foto completa del precio. El marco de «es chino, luego es baratísimo» no aplica, y despacharlo como caro es igual de erróneo en cuanto lo comparas con Occidente.
5. Todavía nadie puede descargarlo: en qué punto están los pesos abiertos
Los medios ni siquiera coinciden en cómo llamarlo. VentureBeat titula que es el mayor modelo de código abierto de la historia y SCMP habla del mayor modelo de IA de código abierto del mundo, mientras que Reuters escribe «de pesos abiertos». Este último es el término técnicamente correcto, y estas son las razones.
El repositorio moonshotai/Kimi-K3 en Hugging Face sigue mostrando una cuenta atrás, sin un solo archivo safetensors en la lista. La ficha del modelo en Artificial Analysis también lo marca como propietario. Comprobado el 27 de julio de 2026, que es la fecha de publicación prevista, así que es muy probable que la situación haya cambiado cuando leas esto. Sigue el enlace de arriba para ver el estado actual.
A 17 de julio, Northflank afirma sin rodeos que la licencia no está anunciada. Una publicación de la comunidad en Hugging Face la da igualmente por determinar hasta que lleguen los pesos. La afirmación de que será «Modified MIT» es una inferencia de segunda mano a partir de la generación K2 y no está cerrada.
Lo que se ha prometido son los pesos entrenados, no los datos ni el código de entrenamiento. El nombre exacto de ese planteamiento es pesos abiertos, que es algo distinto del código abierto tal y como lo define la OSI.
Aun cuando se publique, esto no es algo que un particular pueda ejecutar. A 4 bits (MXFP4), solo los pesos ocupan alrededor de 1,4 TB y, con margen para la caché KV y las activaciones, Northflank estima que hace falta algo del orden de ocho nodos de ocho GPU de 80 GB, mientras que Moonshot recomienda un supernodo de 64 aceleradores o más. No cabe en una sola H100, H200 ni B200, un clúster distribuido es obligatorio y el despliegue en producción es, en la práctica, solo Linux y NVIDIA. Esto no se parece en nada a los montajes personales que repasamos en los requisitos de hardware para LLM locales.
Dicho esto, sigue importando, y mucho. En cuanto unos pesos de nivel frontera aterrizan, las organizaciones que no pueden dejar salir sus datos —sectores regulados, organismos públicos— pueden ejecutarlos de puertas adentro. La mera existencia de un modelo público en igualdad de condiciones cambia el poder de negociación de las API cerradas. Las premisas de cómo elegir un modelo abierto necesitan una actualización por culpa de este lanzamiento.
6. Cuánto cayó la bolsa estadounidense: las cifras cambian según el medio
Las acciones de semiconductores estadounidenses sí sufrieron ventas durante la semana del lanzamiento. Pero los porcentajes de caída publicados no coinciden entre medios, así que aquí se dan como horquillas y no como datos cerrados.
| Qué se movió | Movimiento publicado | Fuente y notas |
|---|---|---|
| Nasdaq | -1,5 % el viernes (su peor sesión de la semana) | Yahoo Finance |
| Bolsa de Taiwán | Más de -6 % | Ídem |
| Bolsa japonesa | Cerró en -4 % | Ídem |
| ETF de semiconductores (SMH) | Más de un 20 % por debajo de su máximo de finales de junio | Ídem |
| Índice de semiconductores de Filadelfia (SOX) | Entre -9 % y -12,5 % en la semana | ⚠️ La cifra varía según el medio («12,5 %, la peor semana en 15 meses», «más del 9 %», «en torno al 10 %, la mayor caída desde abril de 2025») |
| Valores concretos (17 de julio) | AMD -5 %, Intel -4 %, NVIDIA -3 % (todos intradía y recuperados después) | 24/7 Wall St. |
| Valores chinos de IA cotizados en Hong Kong | Zhipu -28,4 %, MiniMax -15,6 % (17 de julio) | Forbes. Los valores chinos se vendieron con más fuerza |
Como comparación, en el shock DeepSeek de enero de 2025 al que todo el mundo recurre, Yahoo Finance informó de que solo NVIDIA perdió unos 590.000 millones de dólares de capitalización en una única sesión. Esta vez la caída de NVIDIA fue del 3 % intradía: una escala completamente distinta.
🟡 La caída ya se ha recuperado
Yahoo Finance informó después de que entraron compradores a la baja y los valores de chips recortaron sus pérdidas, y Bank of America adoptó la lectura tranquila de que se trataba de una simple corrección de verano. Los analistas también están divididos. Robin Zhu, de Bernstein, presentó K3 como algo confirmatorio: un dato más dentro de la tendencia ya conocida de los laboratorios chinos acortando distancias. Gary Yu, de Morgan Stanley, en cambio, dijo que K3 ha tenido una acogida favorable en todo el mundo y demuestra que los LLM chinos están alcanzando a los líderes estadounidenses tanto en escala de modelo como en rendimiento y precio.
Circula además una cifra según la cual se evaporaron 470.000 millones de dólares de valor ligado a la IA en tres días, pero su rastro lleva a un teletipo de un medio de criptomonedas y no ha podido corroborarse en la gran prensa financiera, así que este artículo no la utiliza.
7. La acusación de destilación y la réplica
Entre el 22 y el 23 de julio, la historia pasó de la tecnología a la geopolítica. Michael Kratsios, director de la Oficina de Política Científica y Tecnológica de la Casa Blanca (OSTP), hizo dos afirmaciones sobre Moonshot, según recogieron CNBC, The Hill, Yahoo News y otros.
Que Moonshot obtuvo servidores equipados con NVIDIA GB300 y que además tuvo acceso a GB300 en Tailandia, posiblemente usándolos para entrenar sus propios modelos. La GB300 es una pieza de la generación Blackwell y no puede venderse legalmente en China.
Que la empresa llevó a cabo una destilación encubierta a escala industrial contra Fable, de Anthropic, e incluso montó una plataforma específica que rotaba los métodos de acceso para eludir la detección. Jacob Helberg, que le acompañaba, lo calificó de robo de valiosa propiedad intelectual estadounidense.
Randy Xian, empleado de Moonshot, respondió con ironía en X que Fable se hizo público el 1 de julio y K3 salió el 15, así que por lo visto entrenamos un modelo frontera desde cero en 15 días: para el libro de los récords. El investigador de IA Braden Hancock declaró a TechCrunch que Fable solo estaba disponible desde el 1 de julio y que destilar esa cantidad de datos, entrenar con ellos y lanzar en dos semanas es imposible.
🔴 No se ha hecho pública ninguna prueba. Según SCMP, varios especialistas en IA calificaron la acusación de política e imprudente, y señalaron que las salidas de un modelo no son objeto de derechos de autor de entrada. Reuters, citando cables diplomáticos, informó de que el Departamento de Estado había instruido ya en abril a las embajadas para que informaran a los gobiernos anfitriones sobre la vulneración de propiedad intelectual por parte de empresas de IA chinas, con Moonshot entre las mencionadas. Dicho de otro modo, estas acusaciones son anteriores al lanzamiento de K3, y no se ha aportado ninguna prueba específica sobre K3.
El bando estadounidense tampoco está unido en esto. NVIDIA criticó públicamente a Anthropic por su nombre, afirmando, a propósito de lo que sostiene Anthropic sobre las lagunas en los controles de exportación, que las empresas estadounidenses deberían centrarse en innovar y estar a la altura del reto en lugar de contar milongas.
8. Puntos débiles: velocidad, alucinaciones y la autocrítica de Moonshot
Detrás de los titulares sobre rendimiento quedan tres debilidades que muerden en producción.
Las mediciones en vivo de Artificial Analysis muestran 33 tokens por segundo (puesto 145 de 190 modelos) y 177 segundos hasta el primer token. Northflank, en cambio, reporta 62 tokens por segundo y 1,99 segundos. Casi toda esa diferencia es tensión de capacidad por una demanda desbordada: OpenRouter incluye un aviso en el modelo de que la capacidad aguas arriba está limitada y los errores 429 pueden ser frecuentes.
Artificial Analysis informa de que, si bien la precisión mejoró, la tasa de alucinación subió del 39 % al 51 %. Una puntuación de inteligencia más alta no es lo mismo que veracidad, y este no es un modelo que puedas usar sin verificar.
La empresa afirma que existe una diferencia clara de experiencia de uso entre su modelo y tanto Claude Fable 5 como GPT-5.6 Sol. Su propia lectura es que unos márgenes estrechos en los benchmarks y la sensación que deja un modelo en el uso diario son dos cosas distintas.
9. Cómo probarlo hoy mismo
Antes de que lleguen los pesos, hay tres formas de probarlo.
| Vía | Detalles | A quién le encaja |
|---|---|---|
| App y web oficiales de Kimi | A través de kimi.com. Hay un plan gratuito | Cualquiera que solo quiera juzgar la calidad |
| API de Moonshot | $3 de entrada, $15 de salida, $0,30 con acierto de caché (por millón de tokens) | Equipos que lo integran en su propio producto |
| A través de OpenRouter | OpenRouter. El mismo endpoint por el que ya llamas a otros modelos | Quien esté comparando varios modelos |
| Autoalojamiento | Tras la publicación de los pesos (prevista para el 27 de julio). La recomendación son 64 aceleradores o más, y necesitas planificación consciente de MoE en vLLM, TensorRT-LLM o SGLang | Organizaciones cuyos datos no pueden salir de casa |
Ten en cuenta, eso sí, que como se ha señalado arriba la capacidad está tensionada y los 429 son habituales. Antes de mover una carga de producción entera, el enfoque realista —el mismo razonamiento que en elegir entre nube y local— es enviarle una porción del tráfico con un plan de reserva preparado.
10. Las afirmaciones, ordenadas por nivel de certeza
- API publicada el 16 de julio de 2026; 2,8 billones de parámetros totales; 16 de 896 expertos activos; 1 millón de tokens
- Precio de API de $3 de entrada, $15 de salida y $0,30 en caché
- 57 puntos en el Artificial Analysis Intelligence Index
- 1668 en GDPval-AA v2 (Fable 5 = 1760, Opus 4.8 = 1600)
- Primer puesto con 1679 en Frontend Code Arena
- Coste por tarea de $0,94, por debajo de los $1,80 de Opus 4.8
- Tasa de alucinación al alza, del 39 % al 51 %
- Su puesto en el Intelligence Index (circulan 3.º, 4.º y 7.º)
- La caída semanal del SOX (entre -9 % y -12,5 %)
- La velocidad de salida (33 tok/s frente a 62 tok/s)
- Los «unos 50.000 millones» de parámetros activos (una estimación, no un dato oficial)
- Una licencia «Modified MIT» (inferida a partir de K2)
- La acusación de destilación: sin pruebas públicas, y los investigadores la rechazan por el calendario
- El acceso a chips embargados: afirmación de un cargo estadounidense; no son públicas ni la respuesta formal de Moonshot ni prueba alguna
- Los pesos y la licencia: sin publicar al cierre de este artículo (previstos para el 27 de julio)
- Los «470.000 millones de dólares de valor de IA perdidos en tres días»: no ha podido corroborarse en la gran prensa financiera
En resumen, la historia real de Kimi K3 es que un modelo abierto chino se ha puesto a tiro de la frontera. Ha llegado ahí entre un 40 % y un 50 % por debajo de los precios frontera occidentales, aunque no con un descuento de un orden de magnitud; queda por detrás de Fable 5 y GPT-5.6 Sol en conjunto; es lento; y alucina más. Aun así, subió 478 puntos en GDPval-AA v2 en una sola generación y se ha comprometido a publicar sus pesos, y eso es lo que reaccionó el mercado.
Preguntas frecuentes
P1. ¿Kimi K3 es de código abierto?
No. Lo previsto es la publicación de los pesos entrenados, es decir, pesos abiertos, no la de los datos ni del código de entrenamiento. Además, al cierre de este artículo los pesos siguen sin salir: la página moonshotai/Kimi-K3 de Hugging Face sigue mostrando una cuenta atrás y no se ha anunciado ninguna licencia. La publicación está prevista para el 27 de julio de 2026.
P2. ¿De verdad es tercero en los benchmarks?
La base son 57 puntos y el tercer puesto en el Intelligence Index de Artificial Analysis, por detrás de Claude Fable 5 y GPT-5.6 Sol, y a 17 de julio de 2026 esa lectura es correcta. Pero también existen recuentos que sitúan esos mismos 57 puntos en cuarta y séptima posición, porque el resultado cambia según cómo se trace el conjunto comparado y cuándo se haga el recuento. Lee ese «tercero» como una foto fija. En la Frontend Code Arena, centrada en código, se lleva el primer puesto, mientras que en FrontierSWE pierde frente a Fable 5.
P3. ¿De verdad es barato?
Depende de con qué lo compares. A $3 de entrada y $15 de salida por millón de tokens es alrededor de un 40 % más barato en entrada y entre un 40 % y un 50 % más barato en salida que Claude Opus 4.8 ($5/$25) o GPT-5.6 Sol ($5/$30), así que frente a la frontera occidental es claramente económico. El coste medido coincide: $0,94 por tarea frente a $1,80 de Opus 4.8 (Artificial Analysis). Frente a los rivales chinos, en cambio, es el más caro del grupo: unas tres veces GLM-5.2 y 23 veces DeepSeek V4 Pro. Simon Willison lo llama el modelo más caro que ha lanzado ningún laboratorio de IA chino. Este no es el descuento de un orden de magnitud del shock DeepSeek.
P4. ¿Por qué cayó la bolsa estadounidense?
Por el temor a que unos modelos chinos baratos reduzcan la demanda de cómputo caro. Durante la semana del lanzamiento, el Nasdaq cayó un 1,5 % el viernes, Taiwán más de un 6 %, Japón un 4 %, y el ETF de semiconductores (SMH) acumulaba más de un 20 % por debajo de su máximo de finales de junio. Dicho esto, los valores de chips recortaron después sus pérdidas al entrar compradores a la baja, y Bank of America lo calificó de simple corrección de verano. La escala es distinta de la del shock DeepSeek, cuando solo NVIDIA perdió unos 590.000 millones de dólares en un único día de enero de 2025.
P5. ¿Es cierto que robaron el modelo de Anthropic?
No se ha hecho pública ninguna prueba. Michael Kratsios, director de la OSTP de la Casa Blanca, denunció una destilación a escala industrial de Fable, de Anthropic, pero Moonshot lo niega y señala la ventana de 15 días entre la publicación de Fable el 1 de julio y el lanzamiento de K3 el 15 de julio. El investigador de IA Braden Hancock declaró igualmente a TechCrunch que destilar, entrenar y publicar en dos semanas es imposible. Según SCMP, varios especialistas criticaron la acusación por política. A día de hoy no hay material suficiente para emitir un veredicto.
P6. ¿Puedo ejecutarlo en mi propio PC?
No. Incluso con cuantización a 4 bits (MXFP4), solo los pesos rondan 1,4 TB, algo que no cabe en una sola H100, H200 ni B200. Northflank estima algo así como ocho nodos de ocho GPU de 80 GB, y Moonshot recomienda 64 aceleradores o más. macOS y Windows quedan fuera del uso en producción; la premisa es Linux más NVIDIA. Esto es una escala completamente distinta de ejecutar un LLM local por tu cuenta.
P7. ¿Debería usarlo en producción?
Cambiarse por completo y de golpe no es aconsejable, por tres motivos: (1) la capacidad está tensionada y los errores 429 pueden ser frecuentes (aviso del propio OpenRouter); (2) la tasa de alucinación subió del 39 % al 51 %; y (3) la propia Moonshot admite una diferencia clara de experiencia de uso frente a Fable 5 y GPT-5.6 Sol. El camino realista es mantener un plan de reserva y enviarle una parte del tráfico en un área donde destaca, como la generación de código de front-end, y comparar después.
P8. ¿Cuánto mejor es que el K2.6 anterior?
El tamaño del salto es aquí lo verdaderamente relevante. En el GDPval-AA v2 de Artificial Analysis pasó de 1190 a 1668, una ganancia de 478 puntos, y en AA-Briefcase, la evaluación agéntica privada de la firma, ganó 732 puntos. En la Frontend Code Arena de Arena.ai subió 17 puestos, del 18.º al 1.º. Lo que respondió el mercado tuvo menos que ver con la posición absoluta que con cuánto terreno recortó en una sola generación.
Artículos relacionados
- Análisis a fondo del lanzamiento de Claude Fable 5: características, benchmarks, precio, la diferencia con Mythos y un nuevo diseño de seguridad
- Lanzamiento de GPT-5.6: la guía completa — Luna/Terra/Sol, benchmarks, precios y vs. Claude
- Claude Opus 5: en qué se diferencia de Opus 4.8 y Fable 5, y qué vigilar al migrar
- Los mejores modelos LLM locales comparados [2026]: cómo elegir por uso y tamaño
- ¿Qué especificaciones necesita un PC para un LLM local? Guía rápida de VRAM, GPU y RAM [2026]
- Guía completa de los formatos de cuantización: GGUF, GPTQ, AWQ y qué archivo elegir