Saltar al contenido
Temas

Desarrollo con IA y Programación: Crea Apps con IA

Desarrolla mejor con IA. Guías de generación de código, creación de apps, depuración y automatización.

97 artículos

Ordena los artículos para encontrar lo que necesitas

Artículos en Desarrollo IA y Programación

¿El límite semanal de Claude Code se reinicia de verdad cada 7 días? Investigando la recuperación anticipada (septiembre de 2026)

¿El límite semanal de Claude Code se reinicia de verdad cada 7 días? Investigando la recuperación anticipada (septiembre de 2026)

Alcanzas el límite semanal de tokens de Claude Code y, aun así, la asignación se recupera por completo antes de que pasen siete días, y más de una vez. En Internet incluso hay textos sobre un "mecanismo oculto" que afirman que el límite semanal se reinicia cada 72 horas. ¿Es cierto? Este artículo rastrea el fenómeno hasta sus fuentes primarias. Pero Anthropic no ha documentado el mecanismo interno de reinicio, y los límites cambian constantemente, así que etiquetamos con claridad tres tipos de información: hechos verificables en fuentes oficiales, sucesos que múltiples usuarios observan de forma reproducible pero que Anthropic nunca abordó, y especulación de una sola fuente y sin confirmar. La clave: la recuperación total anticipada es, en la mayoría de los casos, fruto de los reinicios globales irregulares de Anthropic (anunciados en repetidas ocasiones por @ClaudeDevs); el tiempo de reinicio mostrado también es demostrablemente inestable; y la "cadencia de 72 horas" que circula es de observación única, no reproducida y contradicha por otra observación (24 h), por lo que no puede tomarse como un hecho. Cuando algo no se puede afirmar, lo decimos: una investigación de julio de 2026.

¿Qué es un gateway de LLM (proxy)? Una API para cada proveedor — Guía 2026

¿Qué es un gateway de LLM (proxy)? Una API para cada proveedor — Guía 2026

Lo construiste sobre OpenAI, luego quisiste probar Claude y comparar con Gemini, y perdiste horas por los distintos SDKs, formatos y manejo de errores de cada proveedor. Un gateway de LLM (AI gateway / proxy de LLM) es un relé que encajas entre tu app y los proveedores: expone una sola API compatible con OpenAI para alcanzar cualquier modelo y asume las tareas transversales: fallback, seguimiento de costes, claves virtuales, caché, limitación de tasa y observabilidad. Esta guía cubre por qué necesitas uno, qué es realmente un gateway, los tres tipos (proxy autoalojado = LiteLLM / alojado = OpenRouter / SDK = Vercel AI SDK), cómo elegir entre LiteLLM, OpenRouter y el Vercel AI SDK, código de configuración mínimo que solo cambia el endpoint, y los límites: un salto de latencia, el gateway como nuevo punto de fallo, comisiones (OpenRouter cobra el 5,5 % sobre las compras), pérdida de funcionalidades y privacidad.

Cómo crear evals para agentes de IA: pasos, errores y herramientas (2026)

Cómo crear evals para agentes de IA: pasos, errores y herramientas (2026)

Después de construir un agente de IA, siempre te topas con el mismo muro: "Vale, pero ¿de verdad funciona?". El mecanismo para decidir si un cambio de prompt o modelo lo hizo mejor o peor con datos en lugar de intuición son las evals. Los LLM producen una salida distinta cada vez para la misma entrada, así que las pruebas unitarias de coincidencia exacta no encajan. Este artículo se centra en los pasos para crear y ejecutar las evals en la práctica, y cubre cinco formas de medir la calidad (① coincidencia con la verdad de referencia ② comprobaciones por reglas ③ LLM-as-judge ④ pruebas de regresión ⑤ monitorización en producción), la evaluación específica de agentes (tasa de éxito de la tarea, llamadas correctas a herramientas, trayectoria, coste), cómo empezar en pequeño desde 20 ejemplos de fallo, los errores habituales y las herramientas clave (Anthropic Console/Evals, OpenAI Evals, LangSmith, Langfuse, Ragas), escrito para quienes lo llevan a la práctica.

Agentes de IA frente a RPA: la diferencia y cuándo usar cada uno (2026)

Agentes de IA frente a RPA: la diferencia y cuándo usar cada uno (2026)

La eterna pregunta de la automatización: «¿Agentes de IA o RPA?» La respuesta no es o lo uno o lo otro: elige según el rol, y el patrón ganador de 2026 es un híbrido de ambos. El RPA son «manos» deterministas que ejecutan un procedimiento fijo de forma rápida y precisa (pero se rompen cuando cambia la pantalla/especificación); un agente de IA es un «cerebro» probabilístico que lee la situación y decide (fuerte ante la ambigüedad y las excepciones, pero no idéntico cada vez). Este artículo cubre la diferencia de principio de funcionamiento, una tabla comparativa (el compromiso entre reproducibilidad y resistencia al cambio), cómo elegir (el eje es «¿se puede escribir por completo como reglas?»: sí → RPA, criterio que no puedes plasmar → agente de IA), la tendencia de 2026 (los líderes del RPA UiPath, Automation Anywhere y Blue Prism se vuelven agénticos: convergencia; la pregunta ya no es «cuál de los dos» sino «dónde reside el razonamiento» = orquestación primero) y la respuesta práctica: un híbrido donde el cerebro (agente de IA) gestiona el criterio/la orquestación y las manos (RPA) ejecutan lo determinista; no pongas un agente donde se requiere determinismo, y acompaña el criterio delegado de barreras de seguridad y aprobación humana. Basado en la información oficial de los proveedores, con preguntas frecuentes.

Claude Fable 5 vs Opus 5: ¿cuál usar y cuándo? Guía práctica

Claude Fable 5 vs Opus 5: ¿cuál usar y cuándo? Guía práctica

Claude Fable 5 y Opus 5 son ambos de primer nivel, pero la respuesta no es «siempre Fable 5» ni «siempre Opus 5»: elige según la tarea. Y la llegada de Opus 5 el 24 de julio de 2026 ha movido mucho esa respuesta: la generación anterior, Opus 4.8, era «un escalón por debajo de Fable 5, pero a mitad de precio», mientras que Opus 5 mantiene ese mismo precio de $5 / $25 y además iguala o supera a Fable 5 en los benchmarks agénticos (Frontier-Bench 43.3% frente a 33.7% y OSWorld 2.0 70.6% frente a 66.1%, ambos según la prensa; en CursorBench 3.2 Anthropic afirma que se queda a menos del 0.5% de Fable 5 con aproximadamente la mitad de coste). El razonamiento más exigente de un solo tiro sigue inclinándose hacia Fable 5, aunque por muy poco: Humanity's Last Exam 56.5% frente a 56.3% y DeepSWE v1.1 69.7% frente a 68.8% (cifras de prensa). Las especificaciones coinciden en la ventana de contexto de 1M y la salida máxima de 128K; el modo rápido (unas 2.5 veces) es exclusivo de Opus 5, pero cuesta el doble y solo está en la API de Claude, y Opus 5 tiene el corte de conocimiento más reciente, mayo de 2026. El flujo de decisión: prueba primero con Opus 5 y escala a Fable 5 solo donde se estanque. En la práctica, «Opus 5 como base, Fable 5 para lo difícil» es lo óptimo, respaldado por el cambio automático de la aplicación ante bloqueos de seguridad y por el nuevo modo «default» de reserva de la API. Cubre disponibilidad (suspensión de junio, redespliegue de julio), evitar depender de un único modelo, el ajuste de effort para el coste y unas preguntas frecuentes, enlazando el grupo de artículos de Fable 5 con la guía del lanzamiento de Opus 5.

Frameworks de agentes de IA comparados 2026: LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude, ¿cuál elegir?

Frameworks de agentes de IA comparados 2026: LangGraph, CrewAI, AutoGen, OpenAI, Google, Claude, ¿cuál elegir?

El primer obstáculo al llevar un agente de IA a un trabajo real es "sobre qué framework construirlo". Desde el punto de vista de quien desarrolla y selecciona la tecnología, este artículo compara seis grandes frameworks —LangGraph, CrewAI, AutoGen (integrado en el Microsoft Agent Framework, GA en abril de 2026), OpenAI Agents SDK, Google ADK y Claude Agent SDK— según el enfoque de orquestación (grafo dirigido / crew basada en roles / GroupChat conversacional / handoffs / árbol jerárquico / bucle autónomo de herramientas), lenguaje, curva de aprendizaje, control, madurez en producción, coste de tokens y caso de uso idóneo. La advertencia clave: el framework "más rápido de prototipar" (CrewAI) puede ser el más caro en producción —unos 3× los tokens (41k frente a los 18,5k de LangGraph en un benchmark) y no determinista, lo que lo hace poco apto para finanzas y sanidad. También explica cómo 2026 trajo la interoperabilidad vía MCP (herramientas) y A2A (agente a agente), de modo que agentes de distintos frameworks ya pueden trabajar juntos y el lock-in se ha desvanecido. Incluye una guía de selección por caso de uso y preguntas frecuentes.

Guía completa de Ollama [2026]: instalación, comandos y API

Guía completa de Ollama [2026]: instalación, comandos y API

Ollama es la herramienta de referencia para ejecutar un LLM local en tu propio PC: gratuita, de código abierto y como "Docker para LLM", se encarga de casi toda la configuración para que descargues un modelo y empieces a chatear con un solo comando. Esta guía para principiantes recorre de principio a fin la instalación en Windows, Mac y Linux, los comandos esenciales, cómo obtener y elegir modelos según tu VRAM, el uso de interfaces gráficas como Open WebUI, la API local compatible con OpenAI en localhost:11434 para integrarla en tus apps, la personalización con Modelfile y variables de entorno, y la resolución de los problemas más comunes.

Los mejores modelos LLM locales comparados [2026]: cómo elegir por uso, tamaño y origen

Los mejores modelos LLM locales comparados [2026]: cómo elegir por uso, tamaño y origen

Una vez que puedes ejecutar un LLM local, la duda es qué modelo instalar. Esta guía organiza los principales modelos abiertos de 2026 por desarrollador, país de origen, caso de uso, tamaño y licencia, para que elijas el primero que encaje con tu PC y tus objetivos. Repasamos las familias clave (Qwen, Llama, Gemma, DeepSeek, Mistral, Phi), qué cambia según el país de origen y los modelos pensados para el español, como Salamandra y ALIA del Barcelona Supercomputing Center, junto con las recomendaciones por tamaño, caso de uso y licencia comercial.

¿Qué especificaciones necesita un PC para un LLM local? Guía de VRAM, GPU y memoria [2026]

¿Qué especificaciones necesita un PC para un LLM local? Guía de VRAM, GPU y memoria [2026]

Antes de instalar un LLM local, la gran duda es si funcionará en tu PC, y la respuesta casi siempre se reduce a la VRAM de tu GPU. Esta guía explica cuánta VRAM necesita cada tamaño de modelo (7B, 13B, 32B, 70B) con una tabla rápida y una fórmula sencilla basada en la cuantización Q4. También cubre la trampa de memoria de la caché KV que crece con la longitud de contexto, las velocidades reales en GPUs como la RTX 3060, 4090 y 5090 y en Macs con memoria unificada, y presenta tres configuraciones recomendadas por presupuesto para que sepas exactamente qué comprar.

LLM local vs LLM en la nube (Claude/ChatGPT): diferencias y la brecha de rendimiento [2026]

LLM local vs LLM en la nube (Claude/ChatGPT): diferencias y la brecha de rendimiento [2026]

¿Cómo se compara realmente un LLM local que ejecutas en tu PC con LLM en la nube como Claude, ChatGPT y Gemini? Este artículo pone las diferencias una al lado de la otra en rendimiento, coste, privacidad, hardware y esfuerzo, y expone con honestidad cuánto se ha cerrado en 2026 la a menudo malinterpretada "brecha de rendimiento" gracias al auge de los modelos abiertos. Verás dónde lo local ya basta, dónde la nube sigue liderando y cómo elegir en el orden confidencialidad → calidad → volumen. Para la mayoría, la respuesta es híbrida: lo rutinario en local y las partes difíciles delegadas a la nube.

El ajuste de esfuerzo (effort) de Claude Code: niveles, «Extra», «Max» y Ultracode

El ajuste de esfuerzo (effort) de Claude Code: niveles, «Extra», «Max» y Ultracode

El control deslizante de «Esfuerzo» de Claude Code, de «Más rápido» a «Más inteligente», decide cuánto razonamiento y cuántos tokens dedica la IA a cada respuesta. Te explicamos los 5 niveles de la API (low–max), por qué «Extra» es xhigh y no el máximo, cuál es el modo Ultracode y cómo configurarlo con /effort. Incluye una referencia rápida de qué nivel usar y cuándo.

¿Qué son las Agent Evals? Medir tanto el resultado como la trajectory

¿Qué son las Agent Evals? Medir tanto el resultado como la trajectory

Las agent evals son el proceso de medir sistemáticamente si un agente —uno que usa herramientas y da múltiples pasos para alcanzar un objetivo— puede realmente cumplir sus tareas. Son una evolución de las LLM evals, que amplía el objetivo de "una salida" a "una secuencia de acciones". Como un agente planifica, llama a herramientas y actualiza el estado, la salida final por sí sola no basta; Google señala que hay que entender el "por qué" detrás de las acciones de un agente y divide la evaluación en respuesta final y trajectory. Las cinco dimensiones son: resultado (éxito de la tarea, juzgado por el estado final —si existe una reserva en la DB, no la frase "lo reservé"), trajectory (pasos razonables, herramientas correctas en el orden correcto), corrección en el uso de herramientas (herramienta y argumentos correctos, comprobando nombres de función y tipos), eficiencia (pasos, tokens, coste, latencia —a menudo señales de observabilidad llevadas a la evaluación) y calidad de la respuesta final (via LLM-as-judge o una rúbrica). Los evaluadores son código (rápido/barato/reproducible pero frágil), LLM-as-judge (flexible pero no determinista y necesita calibración) y humano (estándar de oro pero caro —evítalo si es posible). Anthropic recomienda puntuar el resultado, no el camino: el emparejamiento mecánico de trajectory es "demasiado rígido y frágil" porque los agentes encuentran alternativas válidas, mientras que Google y Microsoft ofrecen métricas de coincidencia de trajectory para diagnosticar fallos. Los escollos exclusivos son el no determinismo (pass^k), los errores que se acumulan (p^t), el reward hacking (el brazo robótico de DeepMind fingiendo un agarre) y los conjuntos de eval obsoletos o contaminados. La jugada práctica, según Anthropic: convertir 20-50 fallos de producción en casos de prueba, ejecutar puntuación automatizada en CI, separar capability y regression evals, y escribirlas pronto. Benchmarks como SWE-bench, tau-bench, WebArena, GAIA, OSWorld y BFCL son referencias útiles (las puntuaciones cambian según la versión, así que no las tomes al pie de la letra). Basado en información oficial, con las incertidumbres señaladas.