Saltar al contenido
Temas

Agentes IA y Automatización: RAG, Flujos y Guías

Comprende los agentes IA, RAG y flujos de automatización. Desde conceptos hasta aplicaciones e implementación.

45 artículos

Ordena los artículos para encontrar lo que necesitas

Artículos en Agentes IA y Automatización

Cómo usar ChatGPT Work: agente de trabajo GPT-5.6

Cómo usar ChatGPT Work: agente de trabajo GPT-5.6

ChatGPT Work es el "agente de IA para el trabajo" que OpenAI anunció el 9 de julio de 2026 junto con GPT-5.6. A diferencia de un chat normal que solo responde, reúne el contexto de tus apps y archivos conectados para crear entregables terminados: documentos, hojas de cálculo, diapositivas e incluso apps web. Su cerebro es el nuevo buque insignia GPT-5.6 Sol (basado en Codex), y puede descomponer un proyecto complejo en pasos y seguir trabajando durante horas (Thurrott). Dentro de la app de escritorio unificada conviven tres modos —Work (entregables), Codex (técnico, muestra detalles) y chat normal (conversación)—, con Work posicionado como la "versión de negocio" que oculta el detalle técnico de Codex (9to5Mac). El modelo depende de tu plan: Gratis/Go usan Terra por defecto, mientras que Plus/Pro/Business/Enterprise eligen entre Sol/Terra/Luna (según lo reportado). Su fuerza es incorporar "tu contexto" mediante conectores como Google Drive, SharePoint y Slack, además de MCP; y para empresas, los datos no se usan por defecto para entrenamiento. A partir de Axios, TechCrunch, 9to5Mac, Thurrott y OpenAI, este artículo expone qué es ChatGPT Work, en qué se diferencia del ChatGPT normal y de Codex, qué planes pueden usarlo y con qué apps se conecta, con etiquetas de confianza sobre lo que aún no es oficial.

GPT-5.6 Sol vs Gemini 3.1 Pro: el agente frente al multimodal — benchmarks, precio y cómo elegir (Gemini 3.5 Pro aún no disponible)

GPT-5.6 Sol vs Gemini 3.1 Pro: el agente frente al multimodal — benchmarks, precio y cómo elegir (Gemini 3.5 Pro aún no disponible)

Comparamos el buque insignia de OpenAI GPT-5.6 «Sol» (9 de julio de 2026) con Gemini de Google. Sus puntos fuertes apenas se solapan: Sol arrasa en programación agéntica y de terminal (Terminal-Bench 88.8% vs 68.5%, SWE-bench Pro 64.6% vs 54.2%), mientras que Gemini 3.1 Pro responde con multimodalidad nativa de voz y vídeo, un precio cercano a la mitad y ventaja en MMLU, ARC-AGI-2 y WebDev Arena. Ojo al matiz temporal: el verdadero rival de Google, el 3.5 Pro, todavía no está disponible (llegada prevista a mediados de julio). Repasamos especificaciones, benchmarks, coste real y cómo elegir según tu caso de uso.

GPT-5.6 vs GPT-5.5: qué cambió y a qué modelo migrar (Luna/Terra/Sol)

GPT-5.6 vs GPT-5.5: qué cambió y a qué modelo migrar (Luna/Terra/Sol)

GPT-5.6 no es solo una mejora de rendimiento: reorganiza el buque insignia único de GPT-5.5 en 3 modelos (Luna/Terra/Sol). Lo más relevante es Terra, que ofrece calidad equivalente a GPT-5.5 a un coste mucho menor: en el lanzamiento costaba la mitad y, tras la bajada de precios del 30 de julio de 2026, se quedó en el 40% del precio unitario de GPT-5.5 ($2/$12). Sol, en cambio, mantiene $5/$30 y sube SWE-Bench Pro del 58.6% al 64.6% estimado (+6pt). Analizamos qué ha cambiado, cuánto baja la factura y a qué modelo conviene migrar según tu uso.

GPT-5.6 Sol vs Claude Fable 5: comparativa a fondo de rendimiento, coste y autonomía

GPT-5.6 Sol vs Claude Fable 5: comparativa a fondo de rendimiento, coste y autonomía

El buque insignia de OpenAI, GPT-5.6 «Sol», frente a Claude Fable 5, la gama alta de Anthropic: no es un duelo dentro del mismo rango de precio, sino la disyuntiva entre coste y capacidad. Fable 5 domina la codificación de nivel de producción real (SWE-Bench Pro 80.3%) y la autonomía prolongada de hasta 12 horas; Sol lidera el manejo de terminal (TerminalBench 88.8%), la amplitud como agente y la relación coste-eficacia a mitad de precio. Analizamos benchmarks, coste por tarea completada y cómo repartir el uso de estos dos gigantes asimétricos según cada caso.

GPT-5.6 Sol vs Claude Opus 4.8: comparación a fondo de benchmarks, programación, precio y cómo elegir

GPT-5.6 Sol vs Claude Opus 4.8: comparación a fondo de benchmarks, programación, precio y cómo elegir

Comparación a fondo de los dos gigantes de la programación con IA en 2026: Claude Opus 4.8 (28 de mayo) y el modelo tope de gama Sol de GPT-5.6 (9 de julio). Sus puntos fuertes son casi opuestos: Sol lidera en operación de terminal y capacidad agéntica global (TerminalBench 2.1 88.8% vs 78.9% de Opus, Agents' Last Exam 53.6, Coding Agent Index 80), mientras que Opus 4.8 lidera en programación de nivel producción, matemáticas y contexto largo (SWE-bench Pro 69.2% vs 64.6% de Sol, USAMO 2026 96.7%, GraphWalks 1M 68.1%) y pone en primer plano la honestidad (exceso de confianza reducido a una décima parte, 0% de reporte sin crítica de resultados defectuosos). Además, OpenAI deja sin publicar muchos benchmarks de Sol (SWE-bench Pro, GPQA, AIME, MMLU), así que en el corazón de la programación el ya divulgado Opus tiene la ventaja. Cubrimos la tabla de especificaciones, el detalle de los benchmarks, el problema de los benchmarks no publicados, el coste real ($25 vs $30 de precio unitario frente a +54% de eficiencia de tokens), un mapa de fortalezas y debilidades, la elección por caso de uso y una estrategia de doble proveedor.

Lanzamiento de GPT-5.6: la guía completa — Luna/Terra/Sol, benchmarks, precios y vs. Claude

Lanzamiento de GPT-5.6: la guía completa — Luna/Terra/Sol, benchmarks, precios y vs. Claude

OpenAI puso GPT-5.6 en disponibilidad general el 9 de julio de 2026, sustituyendo la vieja estructura de «estándar + Pro» por un esquema de tres modelos: Luna (rápido y de bajo coste, $0.20/$1.20), Terra (equilibrado, $2/$12, equivalente a GPT-5.5 al 40% del precio unitario de Sol) y Sol (buque insignia, $5/$30); los precios corresponden a la revisión del 30 de julio de 2026. Sol se sitúa primero en Agents' Last Exam (53.6) y en el Coding Agent Index (80), y su 88.8% en TerminalBench 2.1 supera a Claude Fable 5 (86.0%); sin embargo, en el SWE-Bench Pro de nivel de producción, Claude Fable 5 lidera con claridad con un 80.0% frente al 64.6% de Sol. Este artículo cubre las diferencias entre los tres modelos, precios, benchmarks, nuevas funciones (Programmatic Tool Calling, ChatGPT Work y el modelo de voz full-duplex GPT-Live), la disponibilidad por plan de ChatGPT, una comparación con Claude (Fable 5 / Opus 4.8) y cómo elegir según el caso de uso, todo basado en el anuncio oficial de OpenAI y en benchmarks independientes.

¿Qué es un gateway de LLM (proxy)? Una API para cada proveedor — Guía 2026

¿Qué es un gateway de LLM (proxy)? Una API para cada proveedor — Guía 2026

Lo construiste sobre OpenAI, luego quisiste probar Claude y comparar con Gemini, y perdiste horas por los distintos SDKs, formatos y manejo de errores de cada proveedor. Un gateway de LLM (AI gateway / proxy de LLM) es un relé que encajas entre tu app y los proveedores: expone una sola API compatible con OpenAI para alcanzar cualquier modelo y asume las tareas transversales: fallback, seguimiento de costes, claves virtuales, caché, limitación de tasa y observabilidad. Esta guía cubre por qué necesitas uno, qué es realmente un gateway, los tres tipos (proxy autoalojado = LiteLLM / alojado = OpenRouter / SDK = Vercel AI SDK), cómo elegir entre LiteLLM, OpenRouter y el Vercel AI SDK, código de configuración mínimo que solo cambia el endpoint, y los límites: un salto de latencia, el gateway como nuevo punto de fallo, comisiones (OpenRouter cobra el 5,5 % sobre las compras), pérdida de funcionalidades y privacidad.

Evals de agentes de IA: 5 formas de medir la calidad (2026)

Evals de agentes de IA: 5 formas de medir la calidad (2026)

Después de construir un agente de IA, siempre te topas con el mismo muro: "Vale, pero ¿de verdad funciona?". El mecanismo para decidir si un cambio de prompt o modelo lo hizo mejor o peor con datos en lugar de intuición son las evals. Los LLM producen una salida distinta cada vez para la misma entrada, así que las pruebas unitarias de coincidencia exacta no encajan. Este artículo cubre qué son las evals, cinco formas de medir la calidad (① coincidencia con la verdad de referencia ② comprobaciones por reglas ③ LLM-as-judge ④ pruebas de regresión ⑤ monitorización en producción), la evaluación específica de agentes (tasa de éxito de la tarea, llamadas correctas a herramientas, trayectoria, coste), cómo empezar en pequeño desde 20 ejemplos de fallo, los errores habituales y las herramientas clave (Anthropic Console/Evals, OpenAI Evals, LangSmith, Langfuse, Ragas), escrito para quienes lo llevan a la práctica.

Agentes de IA frente a RPA: la diferencia y cuándo usar cada uno (2026)

Agentes de IA frente a RPA: la diferencia y cuándo usar cada uno (2026)

La eterna pregunta de la automatización: «¿Agentes de IA o RPA?» La respuesta no es o lo uno o lo otro: elige según el rol, y el patrón ganador de 2026 es un híbrido de ambos. El RPA son «manos» deterministas que ejecutan un procedimiento fijo de forma rápida y precisa (pero se rompen cuando cambia la pantalla/especificación); un agente de IA es un «cerebro» probabilístico que lee la situación y decide (fuerte ante la ambigüedad y las excepciones, pero no idéntico cada vez). Este artículo cubre la diferencia de principio de funcionamiento, una tabla comparativa (el compromiso entre reproducibilidad y resistencia al cambio), cómo elegir (el eje es «¿se puede escribir por completo como reglas?»: sí → RPA, criterio que no puedes plasmar → agente de IA), la tendencia de 2026 (los líderes del RPA UiPath, Automation Anywhere y Blue Prism se vuelven agénticos: convergencia; la pregunta ya no es «cuál de los dos» sino «dónde reside el razonamiento» = orquestación primero) y la respuesta práctica: un híbrido donde el cerebro (agente de IA) gestiona el criterio/la orquestación y las manos (RPA) ejecutan lo determinista; no pongas un agente donde se requiere determinismo, y acompaña el criterio delegado de barreras de seguridad y aprobación humana. Basado en la información oficial de los proveedores, con preguntas frecuentes.

Cómo dejar que la IA gestione AWS: métodos, ventajas y desventajas (2026)

Cómo dejar que la IA gestione AWS: métodos, ventajas y desventajas (2026)

¿Puedes delegar a la IA la operación de AWS? En 2026 puedes delegar mucho. La propia AWS ofrece Amazon Q Developer y el Agent Toolkit for AWS (mayo de 2026 — más de 40 agent skills + un AWS MCP Server gestionado + plugins), de modo que la IA abarca desde la generación de IaC hasta la operación de recursos. Esta guía enmarca el "delegar" en tres niveles (① generación de código/IaC, ② operación/investigación orientada a lectura, ③ un agente autónomo que opera AWS de verdad), cubre las herramientas principales (Amazon Q Developer, Agent Toolkit, AWS MCP Server, MCP de Terraform, Bedrock AgentCore) — incluida la vía "trae lo tuyo" de darle a Claude Code o Codex la AWS CLI para ejecutar "aws" desde el shell — las ventajas (IaC rápida, clasificación automatizada, ideas de optimización de costes, conocimiento democratizado) y luego el punto clave, las desventajas (proliferación de permisos de IAM, el exceso de privilegios como amplificador del radio de impacto de errores/inyección de prompt, permisos que sobreviven a la tarea, descontrol de costes — con incidentes reales de borrado de BD de producción en 2025-26), a partir de fuentes oficiales de AWS y de proveedores de seguridad. El giro clave: la pregunta no es "¿se puede?" sino "¿cómo delegar sin un descontrol o una explosión de la factura?" — y que la propia AWS integre barreras de IAM, auditoría con CloudTrail y sandboxing en el Agent Toolkit muestra la forma de la respuesta. Incluye los cinco principios (IAM de mínimo privilegio, aprobación humana para operaciones destructivas, observabilidad, credenciales JIT de corta duración, sandboxing) y preguntas frecuentes.

Frameworks de agentes de IA comparados 2026: LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude, ¿cuál elegir?

Frameworks de agentes de IA comparados 2026: LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude, ¿cuál elegir?

El primer obstáculo al llevar un agente de IA a un trabajo real es "sobre qué framework construirlo". Desde el punto de vista de quien desarrolla y selecciona la tecnología, este artículo compara seis grandes frameworks —LangGraph, CrewAI, AutoGen (integrado en el Microsoft Agent Framework, GA en abril de 2026), OpenAI Agents SDK, Google ADK y Claude Agent SDK— según el enfoque de orquestación (grafo dirigido / crew basada en roles / GroupChat conversacional / handoffs / árbol jerárquico / bucle autónomo de herramientas), lenguaje, curva de aprendizaje, control, madurez en producción, coste de tokens y caso de uso idóneo. La advertencia clave: el framework "más rápido de prototipar" (CrewAI) puede ser el más caro en producción —unos 3× los tokens (41k frente a los 18,5k de LangGraph en un benchmark) y no determinista, lo que lo hace poco apto para finanzas y sanidad. También explica cómo 2026 trajo la interoperabilidad vía MCP (herramientas) y A2A (agente a agente), de modo que agentes de distintos frameworks ya pueden trabajar juntos y el lock-in se ha desvanecido. Incluye una guía de selección por caso de uso y preguntas frecuentes.

¿Qué es la observabilidad de IA? Monitorear y trazar LLM y agentes, para principiantes

¿Qué es la observabilidad de IA? Monitorear y trazar LLM y agentes, para principiantes

En "Cómo construir un sistema multiagente" dijimos que hay que instrumentar cada traspaso antes de añadir agentes; la tecnología que sostiene esa instrumentación en producción es la observabilidad de IA. Hace visible lo que los LLM y agentes hacen realmente en producción (qué modelo con qué prompt, qué herramientas y búsquedas, qué se devolvió y cuánto tiempo y dinero costó) para que puedas rastrear hasta la causa. La diferencia decisiva frente al monitoreo habitual: la IA puede devolver 200 OK en 50ms y aun así alucinar con seguridad, así que la mayoría de los fallos de IA son fallos de calidad (alucinación, recuperación débil, respuestas inseguras, tareas incompletas, mal uso de herramientas, regresiones tras cambiar el prompt), no de infraestructura. La observabilidad se apoya en tres pilares: trazas (una petición como un árbol de spans que muestra llamadas a LLM, herramientas, recuperación y cadenas de razonamiento; la estrella de la observación de IA), métricas (latencia, coste, tokens, tasa de errores, throughput) y logs (detalle por evento). El estándar del sector OpenTelemetry y sus convenciones GenAI capturan prompts, respuestas, uso de tokens y llamadas a herramientas/agentes en un esquema neutral que se puede enviar a Datadog/Grafana. La distinción más confundida es observabilidad frente a evaluación (evals): la observabilidad muestra qué pasó (fácil de medir, pero no dice si la respuesta es correcta), mientras que las evals miden si la respuesta es buena (precisión, fundamentación, seguridad) y requieren evaluación explícita. Como el coste y la latencia son fáciles de medir pero la calidad de la respuesta no, las herramientas de 2026 combinan la visualización de trazas con la puntuación de salidas y alertas de degradación. Las métricas se dividen en operativas (coste, latencia, tokens, tasa de errores) y de calidad (alucinación, fundamentación/faithfulness, lo más crítico en RAG, seguridad, cumplimiento de la tarea), con detección de alucinaciones mediante LLM-as-a-judge, similitud semántica y puntuaciones de groundedness. Herramientas principales: LangSmith (LangChain), Langfuse (autoalojable de código abierto), Arize Phoenix (depuración de RAG), MLflow (ciclo de vida), AgentOps (agentes) y OpenTelemetry (el estándar). Empieza capturando trazas (compatibles con OpenTelemetry), visualiza las métricas operativas y luego conecta las evals antes de pasar a producción. En los sistemas multiagente la observación es esencial, ya que los fallos se esconden en cadenas de varios pasos visibles solo en una traza de la sesión completa. Observar más evaluar es lo que hace que la IA sea de calidad de producción. Las figuras y los rasgos se citan de materiales públicos, a modo orientativo.