Saltar al contenido
Temas

Agentes IA y Automatización: RAG, Flujos y Guías

Comprende los agentes IA, RAG y flujos de automatización. Desde conceptos hasta aplicaciones e implementación.

50 artículos

Ordena los artículos para encontrar lo que necesitas

Artículos en Agentes IA y Automatización

¿Qué es Jev? Usos, precios y límites de la IA de decisión de TypeSafe

¿Qué es Jev? Usos, precios y límites de la IA de decisión de TypeSafe

Jev es el modelo de IA de TypeSafe que devuelve opciones, puntuaciones y probabilidades de Sí/No en lugar de generar texto. Explicamos las diferencias entre Choice, Score y Noul, qué significa confidence y cómo estructurar una solicitud de API para asignar casos de soporte. Garantizar el tipo no garantiza decisiones correctas. Esta guía aborda las debilidades documentadas en cálculos, fechas y entradas engañosas, además de los precios, ambos límites de entrada y la evaluación previa al uso en japonés. Se basa en fuentes oficiales, no en pruebas prácticas del rendimiento de la API.

Qué es Projects en Claude Code: cómo reparte Claude los hilos, quién puede usarlo, el requisito de GitHub y lo que cuesta en tokens

Qué es Projects en Claude Code: cómo reparte Claude los hilos, quién puede usarlo, el requisito de GitHub y lo que cuesta en tokens

Projects se ha reconstruido en Claude Code. Hasta ahora un proyecto era una carpeta que guardaba conversaciones y material de referencia; el nuevo Projects es una sola conversación. Tú escribes lo que necesitas, Claude lo divide en hilos, los hilos se ejecutan en paralelo en la nube y cada uno abre un pull request y te informa cuando termina. Cerrar el portátil no los detiene. Antes de lanzarte, eso sí, conviene comprobar tres cosas: las cuentas que pueden usarlo siguen siendo limitadas (es una beta pública de Pro y Max que llega primero a las cuentas sin proyectos existentes), github.com y la Claude GitHub App son un requisito en la práctica, y el ritmo al que se come tu límite de uso no se parece en nada al de una sola sesión. En este artículo repasamos cómo saber si el despliegue ya te ha llegado, con qué arranca un hilo (incluida la trampa por la que las reglas de permisos y los hooks dejan de aplicarse en cuanto un proyecto tiene más de un repositorio), de dónde sale el coste en tokens empezando por el Opus en high que viene por defecto, y cómo elegir entre las cinco formas de trabajar en paralelo: subagentes, agent view, agent teams, dynamic workflows y Projects, todo a partir de la documentación y el blog oficiales.

¿GPT-6 Astra en low sale de verdad más barato? Consumo de tokens, coste y velocidad medidos frente a GPT-5.6 Sol en high

¿GPT-6 Astra en low sale de verdad más barato? Consumo de tokens, coste y velocidad medidos frente a GPT-5.6 Sol en high

Un modelo más nuevo es más listo pero más caro: así solemos razonarlo. Sin embargo, comparar GPT-6 Astra con GPT-5.6 Sol solo por el precio unitario no resuelve nada, porque Astra termina el mismo trabajo con menos tokens. En las mediciones de Artificial Analysis, una firma independiente de evaluación, ejecutar Astra en su ajuste más flojo, low, cuesta por tarea casi exactamente lo mismo que Sol en high ($0.82 frente a $0.81) y además puntúa más alto (46 frente a 42), con un tercio de los tokens de salida y una cuarta parte de la espera hasta que arranca la respuesta. Partiendo de las cifras a 18 de septiembre de 2026, en este artículo repasamos el coste, los tokens y la velocidad en cada nivel de esfuerzo de razonamiento, el desglose que explica por qué un precio unitario 2.5 veces mayor acaba en el mismo total, qué pinta tienen las cifras cuando termine el precio promocional de Sol, cómo se estrecha la diferencia de precio en el trabajo de agentes de programación y los pasos para medirlo todo en tu propio trabajo.

Lanzamiento de GPT-6 Astra: la guía completa — precios, disponibilidad por plan, cambios de migración y comparación con Claude

Lanzamiento de GPT-6 Astra: la guía completa — precios, disponibilidad por plan, cambios de migración y comparación con Claude

OpenAI presentó GPT-6 Astra el 3 de septiembre de 2026. La API está disponible de forma general y sin listas de acceso, el identificador del modelo es gpt-6-astra, el contexto es de 1,050,000 tokens, el precio es de $10 de entrada y $50 de salida por millón de tokens, y el corte de conocimiento es el 30 de abril de 2026. Pero «ya se ha lanzado» y «tu plan puede usarlo» son dos cosas distintas: en ChatGPT Plus no aparece en la pantalla de chat habitual, y la puerta de entrada son ChatGPT Work y Codex. En este artículo repasamos la disponibilidad por plan, cómo plantear los precios cuando un precio unitario del doble puede salir más barato por tarea, los benchmarks que OpenAI nombró de verdad, la capacidad en ciberseguridad que alcanza por primera vez el nivel «Critical» del Preparedness Framework y la línea que OpenAI ha trazado a su alrededor, los cuatro puntos que se rompen al migrar (parámetros de muestreo fuera, Responses API, adiós al esfuerzo none y el ajuste de caché renombrado) y la comparación con Claude Opus 5, Fable 5.1 y Gemini 3.8 Flash, siempre dentro de lo que hemos podido confirmar en fuentes primarias. También explicamos por qué no publicamos la tabla comparativa del tipo «Astra 74.1% frente a Opus 5 96%» que circula por ahí.

El Dispatch de Claude — cómo tu móvil pone a trabajar tu propio ordenador y hasta qué punto es seguro

El Dispatch de Claude — cómo tu móvil pone a trabajar tu propio ordenador y hasta qué punto es seguro

Dispatch es la función con la que mandas una instrucción desde el móvil y Claude ejecuta el trabajo en tu propio ordenador (en beta, planes Pro y Max). No corre en la nube: se mueve tu máquina real, y de ese único hecho salen a la vez todo su valor y todo su peligro. La ayuda oficial dice que puedes escribir a Claude desde el móvil y que trabaje en tu ordenador de escritorio, usando los mismos connectors, plugins y acceso a archivos que ya tengas configurados en Cowork, dentro de lo que Anthropic plantea como una única conversación continua a la que se llega desde cualquiera de los dos dispositivos. Para que funcione, el ordenador tiene que estar despierto y con la aplicación de escritorio abierta, y el computer use solo está disponible en macOS y Windows, nunca en Linux. Mecánicamente trabaja bajando por tres niveles de prioridad: un connector si lo hay, la navegación por el navegador si no lo hay, y la interacción directa con la pantalla como último recurso, tomando capturas por el camino para entender lo que se ve. La valoración empieza justo ahí. Los puntos donde se detiene están diseñados: el computer use viene desactivado por defecto y se activa en Ajustes, General; el permiso se pide para cada aplicación nueva; borrar un archivo de forma permanente exige permiso explícito; y las plataformas de inversión y trading y las aplicaciones de criptomonedas quedan vetadas por defecto. Pero también hay puntos donde no se detiene. Las acciones concretas dentro de una aplicación ya aprobada no se te confirman, y la redacción oficial es que Claude hace clic, escribe y navega por tu pantalla directamente, sin las comprobaciones de permisos que sí filtran las demás herramientas de Cowork. La documentación añade que no hay ningún sandbox entre Claude y lo que hay en tu pantalla, y que las acciones tomadas en una aplicación pueden afectar a otras. El riesgo mayor es la prompt injection, que Anthropic describe con sus propias palabras: el contenido web es un vector principal de ataques de prompt injection, y una instrucción manipulada, un comando inesperado o un enlace de phishing abierto en tu navegador podrían encadenarse hasta acciones difíciles o imposibles de deshacer. Anthropic afirma que escanea las activaciones del modelo para detectar ese comportamiento, pero eso baja la probabilidad sin quitarte a ti la obligación de trazar una línea, y la guía sigue diciendo que pases a la aprobación manual siempre que una tarea toque archivos, cuentas o sitios sensibles. Anthropic nombra el límite sin rodeos: no des permiso de computer use a aplicaciones sensibles, como las de banca, sanidad o administración pública, y evita las cuentas financieras, los documentos legales, la información médica y los datos personales. El artículo cubre también el lado del móvil. Lo que se escapa si lo pierdes no son los datos guardados en el teléfono, sino la capacidad de dar órdenes a tu ordenador, más el contenido de la conversación que sigue viva; y la ayuda oficial de Dispatch no documenta cómo desemparejar un dispositivo ni qué hacer si lo pierdes, así que los remedios vienen del lado de la cuenta: cerrar esa sesión concreta en Ajustes, Cuenta, Sesiones activas; cerrar todas las sesiones desde claude.ai, algo que no está disponible en las aplicaciones móviles y que por tanto exige un navegador web; o simplemente cortar por el lado del ordenador cerrando la aplicación de escritorio o dejando que la máquina se suspenda, que en realidad es lo más rápido porque Dispatch necesita el ordenador despierto y la aplicación abierta. Cierra separando Dispatch y computer use como dos interruptores distintos, distinguiendo ambos del agent view de Claude Code (al que la documentación oficial también llama dispatch) y trazando una línea práctica: empieza por el trabajo que puedes deshacer.

El agent view de Claude Code — cómo se ejecutan las sesiones en paralelo y por dónde se escapa el aislamiento

El agent view de Claude Code — cómo se ejecutan las sesiones en paralelo y por dónde se escapa el aislamiento

El agent view de Claude Code, que se abre con claude agents, es la función para lanzar sesiones independientes en segundo plano una tras otra y gestionarlas todas desde una sola pantalla. La documentación oficial llama dispatch a la operación que realizas ahí, y ese nombre choca con la función homónima de la aplicación de escritorio, así que lo primero es distinguirlas. Los documentos describen el agent view como la función que permite despachar y gestionar muchas sesiones de Claude Code desde una única pantalla, y se trata de una research preview que exige la v2.1.139 o posterior. Este artículo se ciñe a la mecánica y al modelo de seguridad. La primera sorpresa es que cada prompt que escribes en el cuadro de entrada arranca su propia sesión nueva: escribe un segundo y tendrás una segunda sesión al lado de la primera, no una instrucción añadida a la anterior. Las instrucciones posteriores pasan por el peek panel, que se abre con la barra espaciadora y muestra la última salida o la pregunta que la sesión está esperando, no la transcripción entera. El corazón del modelo de seguridad es el aislamiento por worktree. Antes de editar ningún archivo, una sesión en segundo plano se traslada a un git worktree aislado bajo .claude/worktrees/, de modo que las sesiones paralelas leen el mismo checkout pero cada una escribe en el suyo: lecturas compartidas, escrituras separadas. Todo lo que llegaría al checkout principal queda cortado por tres comprobaciones: las ediciones de archivos con Edit, Write y NotebookEdit; los directorios de trabajo de comandos que resuelven al checkout principal o que no se pueden verificar como externos a él; y los intentos de redirigir git con git -C, --git-dir, GIT_DIR, GIT_WORK_TREE o un cd colocado antes de la llamada a git. La decisión se toma a propósito del lado seguro, rechazando lo que no puede verificar, y la misma protección la heredan todos los subagentes que la sesión genere. Aun así no es un muro a nivel de sistema operativo: los archivos de fuera del repositorio y la red quedan fuera de alcance, y los comandos de PowerShell solo reciben la comprobación del directorio de trabajo. Los permisos tampoco se eligen en el momento del dispatch: se heredan del defaultMode de ese directorio, o del permissionMode del frontmatter de un subagente despachado, lo que significa que cuanto más laxa sea tu configuración habitual, más sesiones desatendidas con permisos laxos creas de golpe. Después hay tres cosas que se escapan del aislamiento. Elegir "Sí, no volver a preguntar" guarda la regla en el .claude/settings.local.json del checkout principal, así que se aplica en el checkout principal y en todos los demás worktrees, y sobrevive a la eliminación del worktree donde se concedió. Borrar una sesión en el agent view borra con ella el worktree que creó Claude, de modo que el trabajo sin commit desaparece, y Ctrl+X detiene en la primera pulsación y borra en la segunda. Y .worktreeinclude copia en cada worktree nuevo los archivos ignorados por git, como .env, multiplicando tus credenciales por el número de sesiones que despachas. Encima, la cuota se consume en proporción al paralelismo (diez agentes la gastan unas diez veces más rápido) y las sesiones se ejecutan en local: sobreviven a la suspensión, pero se detienen al apagar la máquina. El artículo cierra situando el agent view entre las cuatro formas oficiales de paralelizar, junto a los subagentes, los agent teams y los flujos de trabajo dinámicos, y da una rutina concreta para antes, durante y después de un dispatch.

Cómo usar ChatGPT Work: agente de trabajo GPT-5.6

Cómo usar ChatGPT Work: agente de trabajo GPT-5.6

ChatGPT Work es el "agente de IA para el trabajo" que OpenAI anunció el 9 de julio de 2026 junto con GPT-5.6. A diferencia de un chat normal que solo responde, reúne el contexto de tus apps y archivos conectados para crear entregables terminados: documentos, hojas de cálculo, diapositivas e incluso apps web. Su cerebro es el nuevo buque insignia GPT-5.6 Sol (basado en Codex), y puede descomponer un proyecto complejo en pasos y seguir trabajando durante horas (Thurrott). Dentro de la app de escritorio unificada conviven tres modos —Work (entregables), Codex (técnico, muestra detalles) y chat normal (conversación)—, con Work posicionado como la "versión de negocio" que oculta el detalle técnico de Codex (9to5Mac). El modelo depende de tu plan: Gratis/Go usan Terra por defecto, mientras que Plus/Pro/Business/Enterprise eligen entre Sol/Terra/Luna (según lo reportado). Su fuerza es incorporar "tu contexto" mediante conectores como Google Drive, SharePoint y Slack, además de MCP; y para empresas, los datos no se usan por defecto para entrenamiento. A partir de Axios, TechCrunch, 9to5Mac, Thurrott y OpenAI, este artículo expone qué es ChatGPT Work, en qué se diferencia del ChatGPT normal y de Codex, qué planes pueden usarlo y con qué apps se conecta, con etiquetas de confianza sobre lo que aún no es oficial.

GPT-5.6 Sol vs Gemini 3.1 Pro: el agente frente al multimodal — benchmarks, precio y cómo elegir (Gemini 3.5 Pro aún no disponible)

GPT-5.6 Sol vs Gemini 3.1 Pro: el agente frente al multimodal — benchmarks, precio y cómo elegir (Gemini 3.5 Pro aún no disponible)

Comparamos el buque insignia de OpenAI GPT-5.6 «Sol» (9 de julio de 2026) con Gemini de Google. Sus puntos fuertes apenas se solapan: Sol arrasa en programación agéntica y de terminal (Terminal-Bench 88.8% vs 68.5%, SWE-bench Pro 64.6% vs 54.2%), mientras que Gemini 3.1 Pro responde con multimodalidad nativa de voz y vídeo, un precio cercano a la mitad y ventaja en MMLU, ARC-AGI-2 y WebDev Arena. Ojo al matiz temporal: el verdadero rival de Google, el 3.5 Pro, todavía no está disponible (llegada prevista a mediados de julio). Repasamos especificaciones, benchmarks, coste real y cómo elegir según tu caso de uso.

GPT-5.6 vs GPT-5.5: qué cambió y a qué modelo migrar (Luna/Terra/Sol)

GPT-5.6 vs GPT-5.5: qué cambió y a qué modelo migrar (Luna/Terra/Sol)

GPT-5.6 no es solo una mejora de rendimiento: reorganiza el buque insignia único de GPT-5.5 en 3 modelos (Luna/Terra/Sol). Lo más relevante es Terra, que ofrece calidad equivalente a GPT-5.5 a un coste mucho menor: en el lanzamiento costaba la mitad y, tras la bajada de precios del 30 de julio de 2026, se quedó en el 40% del precio unitario de GPT-5.5 ($2/$12). Sol, en cambio, mantiene $5/$30 y sube SWE-Bench Pro del 58.6% al 64.6% estimado (+6pt). Analizamos qué ha cambiado, cuánto baja la factura y a qué modelo conviene migrar según tu uso.

GPT-5.6 Sol vs Claude Fable 5: comparativa a fondo de rendimiento, coste y autonomía

GPT-5.6 Sol vs Claude Fable 5: comparativa a fondo de rendimiento, coste y autonomía

El buque insignia de OpenAI, GPT-5.6 «Sol», frente a Claude Fable 5, la gama alta de Anthropic: no es un duelo dentro del mismo rango de precio, sino la disyuntiva entre coste y capacidad. Fable 5 domina la codificación de nivel de producción real (SWE-Bench Pro 80.3%) y la autonomía prolongada de hasta 12 horas; Sol lidera el manejo de terminal (TerminalBench 88.8%), la amplitud como agente y la relación coste-eficacia a mitad de precio. Analizamos benchmarks, coste por tarea completada y cómo repartir el uso de estos dos gigantes asimétricos según cada caso.

GPT-5.6 Sol vs Claude Opus 4.8: comparación a fondo de benchmarks, programación, precio y cómo elegir

GPT-5.6 Sol vs Claude Opus 4.8: comparación a fondo de benchmarks, programación, precio y cómo elegir

Comparación a fondo de los dos gigantes de la programación con IA en 2026: Claude Opus 4.8 (28 de mayo) y el modelo tope de gama Sol de GPT-5.6 (9 de julio). Sus puntos fuertes son casi opuestos: Sol lidera en operación de terminal y capacidad agéntica global (TerminalBench 2.1 88.8% vs 78.9% de Opus, Agents' Last Exam 53.6, Coding Agent Index 80), mientras que Opus 4.8 lidera en programación de nivel producción, matemáticas y contexto largo (SWE-bench Pro 69.2% vs 64.6% de Sol, USAMO 2026 96.7%, GraphWalks 1M 68.1%) y pone en primer plano la honestidad (exceso de confianza reducido a una décima parte, 0% de reporte sin crítica de resultados defectuosos). Además, OpenAI deja sin publicar muchos benchmarks de Sol (SWE-bench Pro, GPQA, AIME, MMLU), así que en el corazón de la programación el ya divulgado Opus tiene la ventaja. Cubrimos la tabla de especificaciones, el detalle de los benchmarks, el problema de los benchmarks no publicados, el coste real ($25 vs $30 de precio unitario frente a +54% de eficiencia de tokens), un mapa de fortalezas y debilidades, la elección por caso de uso y una estrategia de doble proveedor.

Lanzamiento de GPT-5.6: la guía completa — Luna/Terra/Sol, benchmarks, precios y vs. Claude

Lanzamiento de GPT-5.6: la guía completa — Luna/Terra/Sol, benchmarks, precios y vs. Claude

OpenAI puso GPT-5.6 en disponibilidad general el 9 de julio de 2026, sustituyendo la vieja estructura de «estándar + Pro» por un esquema de tres modelos: Luna (rápido y de bajo coste, $0.20/$1.20), Terra (equilibrado, $2/$12, equivalente a GPT-5.5 al 40% del precio unitario de Sol) y Sol (buque insignia, $5/$30); los precios corresponden a la revisión del 30 de julio de 2026. Sol se sitúa primero en Agents' Last Exam (53.6) y en el Coding Agent Index (80), y su 88.8% en TerminalBench 2.1 supera a Claude Fable 5 (86.0%); sin embargo, en el SWE-Bench Pro de nivel de producción, Claude Fable 5 lidera con claridad con un 80.0% frente al 64.6% de Sol. Este artículo cubre las diferencias entre los tres modelos, precios, benchmarks, nuevas funciones (Programmatic Tool Calling, ChatGPT Work y el modelo de voz full-duplex GPT-Live), la disponibilidad por plan de ChatGPT, una comparación con Claude (Fable 5 / Opus 4.8) y cómo elegir según el caso de uso, todo basado en el anuncio oficial de OpenAI y en benchmarks independientes.