Saltar al contenido
Herramientas de IA

Otras Herramientas IA: Reseñas y Comparaciones

Descubre y compara herramientas IA emergentes. Reseñas, características y guías prácticas.

48 artículos

Ordena los artículos para encontrar lo que necesitas

¿Qué es Kimi K3? El modelo de 2,8 billones de parámetros tras el «tercer puesto»: precio, pesos abiertos e impacto en bolsa

¿Qué es Kimi K3? El modelo de 2,8 billones de parámetros tras el «tercer puesto»: precio, pesos abiertos e impacto en bolsa

El 16 de julio de 2026, Moonshot AI lanzó Kimi K3, un modelo con 2,8 billones de parámetros totales. Las acciones de semiconductores estadounidenses sufrieron ventas masivas y la historia escaló hasta que un alto cargo de la Casa Blanca acusó a la empresa, por su nombre, de destilar los modelos de Anthropic. Como las cifras, e incluso las etiquetas, no coinciden según la fuente, este artículo contrasta a quienes publican los benchmarks, a la prensa financiera, los anuncios de la propia Moonshot y la página real de Hugging Face, indicando quién produjo cada dato. En rendimiento suma 57 puntos y el tercer puesto en el Artificial Analysis Intelligence Index (a 17 de julio de 2026, aunque también existen recuentos que sitúan esos mismos 57 puntos en cuarta y séptima posición). En GDPval-AA v2, la métrica más práctica, K3 marca 1668 frente a los 1760 de Fable 5 y los 1600 de Opus 4.8: un salto de 478 puntos respecto a los 1190 del K2.6 de la generación anterior, y es ese recorte de distancia, más que la posición absoluta, lo que movió al mercado. En código se llevó el primer puesto en la Frontend Code Arena de Arena.ai con 1679 (Fable 5, 1631), pero en FrontierSWE pierde: 81,2 % frente al 86,6 % de Fable 5. El precio se invierte según la comparación: $3 de entrada y $15 de salida es alrededor de un 40 % más barato en entrada y entre un 40 % y un 50 % más barato en salida que Claude Opus 4.8 ($5/$25) o GPT-5.6 Sol ($5/$30), y el coste medido de $0,94 por tarea queda por debajo de los $1,80 de Opus 4.8. Frente a los rivales chinos, en cambio, es el más caro del grupo, unas tres veces GLM-5.2 y 23 veces DeepSeek V4 Pro, así que no estamos ante el descuento de un orden de magnitud del shock DeepSeek. Sobre los pesos, los medios se dividen entre «código abierto» (VentureBeat, SCMP) y el «pesos abiertos» de Reuters, y este último es el término exacto. Los pesos salieron el 27 de julio de 2026, en la fecha prevista, y se descargan desde Hugging Face sin solicitud de acceso (96 fragmentos safetensors). La licencia publicada junto a ellos es la propia «Kimi K3 License» de Moonshot: sobre una base de permiso al estilo MIT añade dos condiciones, un acuerdo aparte si se explota un negocio de Model as a Service que facture más de 20 millones de dólares y mostrar «Kimi K3» en la interfaz de los productos con más de 100 millones de usuarios mensuales. Como el permiso cambia según el tamaño de quien lo usa, no es código abierto según la OSI, y el articulado de la licencia zanja la discusión sobre la etiqueta. En los mercados, el Nasdaq cayó un 1,5 % el viernes, Taiwán más de un 6 %, Japón un 4 %, y el ETF de semiconductores (SMH) llegó a acumular más de un 20 % por debajo de su máximo de finales de junio, pero la caída semanal del SOX se publica entre -9 % y -12,5 % según el medio, y las pérdidas se recortaron después con la entrada de compradores a la baja. La acusación de destilación la rechazan los investigadores por el calendario —15 días entre la publicación de Fable el 1 de julio y el lanzamiento de K3 el 15— y no se ha hecho pública ninguna prueba. La velocidad (mediciones que van de 33 a 62 tokens por segundo, con OpenRouter avisando de errores 429 frecuentes por tensión de capacidad), la tasa de alucinación al alza del 39 % al 51 % y la clara diferencia de experiencia de uso que la propia Moonshot admite se cubren aquí con etiquetas de certeza explícitas.

Claude Opus 5: en qué se diferencia de Opus 4.8 y Fable 5

Claude Opus 5: en qué se diferencia de Opus 4.8 y Fable 5

Anthropic lanzó Claude Opus 5 el 24 de julio de 2026 y su propia documentación lo describe como un salto cualitativo, no como una mejora incremental sobre Opus 4.8. Aun así, el precio no se mueve: $5 de entrada y $25 de salida por millón de tokens, exactamente la mitad que el buque insignia Fable 5 ($10 / $50). Este artículo contrasta el anuncio oficial y la documentación con varias informaciones de prensa y repasa las especificaciones principales (claude-opus-5, una ventana de 1M de tokens que es a la vez el valor por defecto y el máximo, 128K de salida máxima y un corte de conocimiento en mayo de 2026), el precio incluidas las tarifas de caché y el modo rápido (unas 2.5 veces la velocidad al doble de precio, solo en la Claude API), los benchmarks (Anthropic afirma en su propio texto que Frontier-Bench es más del doble que Opus 4.8, que CursorBench 3.2 se queda a menos de un 0.5% de Fable 5, que ARC-AGI 3 triplica al segundo clasificado y que OSWorld 2.0 supera a Fable 5 a alrededor de un tercio del coste; entre las cifras leídas de las gráficas por la prensa están Frontier-Bench 43.3%, ARC-AGI-3 30.2%, GDPval-AA 1,861 y OSWorld 70.6%) y también los terrenos donde sigue perdiendo (68.8% frente al 72.7% de GPT-5.6 Sol en DeepSWE v1.1, la seguridad ofensiva y la investigación biológica de largo recorrido donde lidera Mythos 5, y escenarios en los que el effort max puntúa por debajo de niveles inferiores). Después aborda los dos cambios de la API que rompen compatibilidad (el thinking viene activo por defecto, así que los presupuestos ajustados de max_tokens acaban truncados, y desactivarlo solo se permite con effort high o inferior, porque xhigh o max devuelve un error 400), cómo elegir entre los cinco niveles de effort, novedades como el cambio de herramientas a mitad de conversación, el mínimo de caché de 512 tokens y el modo de reserva por defecto, y el giro de personalidad hacia respuestas más largas, más narración, más delegación y autoverificación no solicitada, con la regla de oro de que migrar consiste en quitar texto del prompt y no en añadirlo. Cierra con quién debería migrar ya y una lista de seis pasos para hacerlo.

Qué es GPT-Live: la voz full-duplex de ChatGPT que escucha mientras habla

Qué es GPT-Live: la voz full-duplex de ChatGPT que escucha mientras habla

El 8 de julio de 2026, OpenAI lanzó GPT-Live, el nuevo modelo que sustituye a Advanced Voice Mode y renueva la voz de ChatGPT con una arquitectura full-duplex: escucha y habla al mismo tiempo, asiente mientras hablas, encaja las interrupciones y no corta el silencio en el que piensas, con una latencia inferior a 250 ms. La inmediatez la asume GPT-Live y el razonamiento profundo y la búsqueda se delegan en GPT-5.5 (Instant/Medium/High). Free usa GPT-Live-1 mini y Go/Plus/Pro usan GPT-Live-1, en iOS, Android y web. Explicamos qué es, en qué se diferencia del modo anterior, cómo funciona, sus límites actuales (sin vídeo ni pantalla, sin API todavía) y su diferencia con GPT-Realtime-2.1.

10 ideas divertidas para dibujar con IA: convierte fotos y garabatos en arte gratis (2026)

10 ideas divertidas para dibujar con IA: convierte fotos y garabatos en arte gratis (2026)

Las personas que abandonaron el dibujo porque "no saben dibujar" son justo aquellas para quienes dibujar con IA es un patio de juegos. Pon en palabras la imagen que tienes en la cabeza y se convierte en arte; una foto del móvil o el garabato de un niño se transforma en una obra en segundos. Esto no es una comparación de herramientas ni un curso serio: es un repertorio de ideas para divertirte solo o en familia. Desde herramientas gratis para empezar (ChatGPT, Google Gemini, Microsoft Copilot, Canva) hasta 10 ideas (① garabato en arte ② foto en un estilo nuevo ③ tu propio personaje por distintas escenas ④ el dibujo de un niño como página de cuento ⑤ emojis originales ⑥ tiras de cuatro viñetas ⑦ mezclas del tipo "¿y si?" ⑧ tus propias páginas para colorear ⑨ reformas de habitación ⑩ duelos de dibujo), pequeños trucos para lograr mejores imágenes y tres cosas que debes saber antes de jugar (no uses caras de otros, comprueba los derechos y el uso comercial, etiquétalo como hecho con IA).

Guía completa de Ollama [2026]: instalación, comandos y API

Guía completa de Ollama [2026]: instalación, comandos y API

Ollama es la herramienta de referencia para ejecutar un LLM local en tu propio PC: gratuita, de código abierto y como "Docker para LLM", se encarga de casi toda la configuración para que descargues un modelo y empieces a chatear con un solo comando. Esta guía para principiantes recorre de principio a fin la instalación en Windows, Mac y Linux, los comandos esenciales, cómo obtener y elegir modelos según tu VRAM, el uso de interfaces gráficas como Open WebUI, la API local compatible con OpenAI en localhost:11434 para integrarla en tus apps, la personalización con Modelfile y variables de entorno, y la resolución de los problemas más comunes.

Los mejores modelos LLM locales comparados [2026]: cómo elegir por uso, tamaño y origen

Los mejores modelos LLM locales comparados [2026]: cómo elegir por uso, tamaño y origen

Una vez que puedes ejecutar un LLM local, la duda es qué modelo instalar. Esta guía organiza los principales modelos abiertos de 2026 por desarrollador, país de origen, caso de uso, tamaño y licencia, para que elijas el primero que encaje con tu PC y tus objetivos. Repasamos las familias clave (Qwen, Llama, Gemma, DeepSeek, Mistral, Phi), qué cambia según el país de origen y los modelos pensados para el español, como Salamandra y ALIA del Barcelona Supercomputing Center, junto con las recomendaciones por tamaño, caso de uso y licencia comercial.

¿Qué especificaciones necesita un PC para un LLM local? Guía de VRAM, GPU y memoria [2026]

¿Qué especificaciones necesita un PC para un LLM local? Guía de VRAM, GPU y memoria [2026]

Antes de instalar un LLM local, la gran duda es si funcionará en tu PC, y la respuesta casi siempre se reduce a la VRAM de tu GPU. Esta guía explica cuánta VRAM necesita cada tamaño de modelo (7B, 13B, 32B, 70B) con una tabla rápida y una fórmula sencilla basada en la cuantización Q4. También cubre la trampa de memoria de la caché KV que crece con la longitud de contexto, las velocidades reales en GPUs como la RTX 3060, 4090 y 5090 y en Macs con memoria unificada, y presenta tres configuraciones recomendadas por presupuesto para que sepas exactamente qué comprar.

LLM local vs LLM en la nube (Claude/ChatGPT): diferencias y la brecha de rendimiento [2026]

LLM local vs LLM en la nube (Claude/ChatGPT): diferencias y la brecha de rendimiento [2026]

¿Cómo se compara realmente un LLM local que ejecutas en tu PC con LLM en la nube como Claude, ChatGPT y Gemini? Este artículo pone las diferencias una al lado de la otra en rendimiento, coste, privacidad, hardware y esfuerzo, y expone con honestidad cuánto se ha cerrado en 2026 la a menudo malinterpretada "brecha de rendimiento" gracias al auge de los modelos abiertos. Verás dónde lo local ya basta, dónde la nube sigue liderando y cómo elegir en el orden confidencialidad → calidad → volumen. Para la mayoría, la respuesta es híbrida: lo rutinario en local y las partes difíciles delegadas a la nube.

¿Qué es LoRA? Personaliza la IA con un poquito de entrenamiento extra

¿Qué es LoRA? Personaliza la IA con un poquito de entrenamiento extra

Volver a entrenar desde cero una IA gigantesca es demasiado caro, pero quieres ajustarla solo para ti; LoRA (Low-Rank Adaptation) cumple ese deseo congelando el modelo original y entrenando solo una pequeña pieza añadida (un adaptador), reduciendo los parámetros entrenables en torno a un 90%. LoRA abarata y acelera enormemente el fine-tuning, y es muy popular en la generación de imágenes como Stable Diffusion como un archivo pequeño que añade un personaje o un estilo. Este artículo lo explica con la analogía del parche. LoRA es el referente del ajuste fino eficiente en parámetros (PEFT): deja congelados los enormes pesos originales, inserta una pequeña matriz añadida en cada capa y entrena solo eso (W = W0 + BA, donde W0 está congelado y BA es la pequeña parte añadida). Se apoya en el descubrimiento de que adaptar una IA no requiere grandes cambios (basta un rango bajo). Ventajas: alrededor de un 90% menos de parámetros entrenables (según se informa, 10,000x menos a escala de GPT-3), menos memoria de GPU (unas 3x menos), entrenamiento más rápido y barato, sin latencia de inferencia una vez fusionado el adaptador, y menor riesgo de sobreajuste. Su mayor fortaleza son los adaptadores intercambiables: mantén una base común y cambia al instante pequeños archivos LoRA (de unos pocos MB) por caso de uso (soporte, tono de empresa, un personaje concreto). Mucha gente conoce LoRA por primera vez en la generación de imágenes, donde se comparten ampliamente LoRA de Stable Diffusion que aprendieron un personaje, estilo o sujeto (añadir un estilo, enseñar un personaje, ligero y fácil de compartir). QLoRA combina la cuantización, entrenando LoRA sobre una base de 4-bit para ~4x menos memoria que el LoRA estándar, lo que permite hacer fine-tuning de modelos enormes en una GPU de consumo (a veces CPU) con una pérdida de precisión mínima. Frente al fine-tuning completo (entrenar todos los pesos), LoRA difiere en los pesos entrenados, el coste, el resultado y el mejor uso; para la mayoría del trabajo, LoRA basta. Conserva la base, sazónala en pequeño. Las cifras se citan de materiales públicos, a modo orientativo.

¿Qué es la cuantización? Encoger modelos de IA para ejecutarlos en tu propia máquina

¿Qué es la cuantización? Encoger modelos de IA para ejecutarlos en tu propia máquina

Que un enorme modelo de 70B corra en un solo PC gaming en casa, en lugar de un rack de GPU de centro de datos, es posible gracias a la cuantización, que reduce la precisión numérica de los pesos de un modelo para encoger drásticamente su tamaño y memoria. Mientras la destilación traslada el conocimiento a otro modelo más pequeño, la cuantización hace más ligero el mismo modelo. Este artículo lo explica con una analogía de compresión de fotos. La cuantización reemplaza los pesos almacenados como decimales FP16/FP32 por enteros INT8 (8 bits) o INT4 (4 bits), recortando los bytes por peso (FP32=4, INT8=1, INT4=0,5); como comprimir una foto RAW a JPEG, sacrificas un poco de precisión a cambio de una gran reducción, y lo sorprendente es lo poco que renuncias. En memoria, 4-bit usa alrededor de un cuarto de FP16: un modelo de 70B baja de ~140GB a ~35GB, y uno de 8B a 4-bit ocupa ~4.5-5GB, que cabe en una GPU de gama media de 8GB de VRAM para uso local (la democratización de los LLM). En precisión, INT8 es casi sin pérdidas e INT4 se degrada por debajo del 4% en tareas generales de preguntas y respuestas o de sentido común, pero la pérdida es más notable en matemáticas, generación de código y razonamiento difícil (se manifiesta como un pequeño aumento de la perplejidad), así que elige el número de bits según la tarea. Métodos principales: GPTQ (pionero del 4-bit preciso), AWQ (protege el ~1% de los pesos más importantes, a menudo 1-2% más preciso y rápido), GGUF (formato llama.cpp/Ollama, Q2_K-Q8_0, híbrido CPU+GPU, para local) y QLoRA (base de 4-bit más LoRA para fine-tuning en GPU de consumo). Se diferencia de la destilación (trasladar a otro modelo pequeño) y del fine-tuning (añadir conocimiento de tarea), y las tres suelen combinarse (cuantizar un modelo destilado; hacer fine-tuning sobre una base cuantizada). Para empezar, ejecuta un modelo GGUF con Ollama en un comando, elige Q4/Q8 según la VRAM y evita INT4 para código o matemáticas exactas. La mayoría de los modelos principales ya vienen cuantizados, así que solo los descargas y usas. Conserva la inteligencia, suelta solo el peso. Las cifras se citan de materiales públicos, orientativas.

¿Qué es la destilación de modelos? Mover el conocimiento de una IA grande a una pequeña

¿Qué es la destilación de modelos? Mover el conocimiento de una IA grande a una pequeña

Una IA enorme y de alto rendimiento es inteligente pero pesada y cara; la destilación de modelos (knowledge distillation) resuelve esto transfiriendo el conocimiento de un gran modelo profesor a un pequeño modelo alumno, conservando más del 95% del rendimiento del profesor con una décima parte del tamaño y la velocidad. Este artículo lo explica con una analogía profesor-alumno. La clave son las soft labels: el entrenamiento normal solo enseña "la respuesta es gato" (hard label), mientras que la destilación transmite la distribución de probabilidad completa del profesor, como "90% gato, 8% perro, 2% zorro", cuyo grado de duda lleva información valiosa; un parámetro temperature suaviza las probabilidades para revelar relaciones sutiles (ejemplo real: GPT-4o mini destilado de GPT-4o). Ventajas: rápido y barato, ~10x más compacto conservando más del 95% del rendimiento, funciona en el edge, potente para la especialización. Dos enfoques: white-box (acceso completo a pesos y representaciones internas, transferencia más profunda; para modelos propios u OSS) y black-box (solo salidas/respuestas de API visibles; usar la API de otra empresa como profesor puede infringir los términos). Se diferencia de la cuantización (comprimir la precisión de los pesos del mismo modelo) y del fine-tuning (seguir entrenando un modelo existente para una tarea): la destilación mueve el conocimiento a un modelo pequeño aparte, y las tres son combinables. La realidad legal/ToS fue un gran tema en 2026: la técnica es legítima, pero OpenAI, Anthropic, Mistral y xAI incluyen cláusulas de destilación anticompetitiva que prohíben usar las salidas para crear modelos competidores, así que destilar un competidor desde una API restringida puede infringir los términos. La disputa OpenAI contra DeepSeek (OpenAI alegó que cuentas vinculadas a DeepSeek eludieron las restricciones para obtener salidas para destilación, mientras que los términos de DeepSeek, según los informes, permiten destilar sus salidas) muestra que la valoración depende de qué términos de API se aplican, y se informa que Claude Fable 5/Mythos 5 restringen las respuestas en trabajos marcados como destilación. Consejos: usa modelos propios u OSS con licencia como profesor, revisa las cláusulas anti-destilación antes de usar una API comercial y valora si el uso es "desarrollar un modelo competidor". La inteligencia, del modelo grande; la operación, del pequeño, pero a quién elijas como profesor cambia el resultado técnica y legalmente. Las cifras provienen de materiales públicos, son orientativas.

¿Qué es el fine-tuning? Fine-tuning vs RAG, LoRA/QLoRA y cuándo usarlo — Guía para principiantes

¿Qué es el fine-tuning? Fine-tuning vs RAG, LoRA/QLoRA y cuándo usarlo — Guía para principiantes

Cuando quieres personalizar la IA para tu propia empresa, el fine-tuning es una de las opciones — pero lánzate sin cuidado y resulta caro y fácil de errar. Esta guía para principiantes explica el fine-tuning (ajuste fino): tomar un modelo base ya entrenado, entrenarlo aún más con datos adaptados a tu uso y remodelarlo en un modelo especializado que graba el "comportamiento" (estilo de la casa, formato de salida, lenguaje de un campo) en el modelo mismo reescribiendo sus pesos. El fine-tuning es bueno cambiando el comportamiento pero malo memorizando conocimiento actualizado, así que la regla es "hechos y conocimiento → RAG, personalidad y molde → fine-tuning, primero los prompts". Como señalan los expertos, cerca del 80% del "necesitamos fine-tuning" se resuelve con una mejor recuperación (RAG) o con el prompting, por lo que el orden importa. El artículo cubre qué es el fine-tuning (con una analogía de la formación de un nuevo empleado), en qué es bueno y en qué es malo, una tabla comparativa de fine-tuning vs RAG vs prompting, los métodos principales (full fine-tuning, LoRA y QLoRA — cuantización de 4-bit lo bastante ligera para principiantes), qué necesitas (500+ ejemplos de alta calidad como guía, siendo construir los datos el trabajo de verdad; costes de $5,000 a más de $50,000, fine-tuning de OpenAI en torno a $25–$100 por millón de tokens de entrenamiento; herramientas como OpenAI, Unsloth, Axolotl y Hugging Face) y el orden en que empezar. El fine-tuning es el último recurso.