Session

Respondió 200 OK (y alucinó): observabilidad para agentes IA

Los agentes de IA fallan de una forma nueva: devuelven HTTP 200, el dashboard de latencia está en verde, y aun así la respuesta es incorrecta, el agente entró en loop o directamente alucinó. La observabilidad a la que estamos acostumbrados no ve nada de eso.

En esta charla separamos la observabilidad de agentes en dos planos y trabajamos ambos con herramientas abiertas. Primero, la telemetría de ejecución: cómo Strands —el framework de agentes que impulsa AWS— emite spans de OpenTelemetry de forma nativa (invoke_agent, execute_tool, chat con tokens y time-to-first-token) y cómo leer ese árbol para cazar loops, tool calls fallidas y costos que se disparan. Segundo, el plano que las semantic conventions todavía no resuelven del todo: la calidad de la salida. Ahí entran la evaluación con LLM-as-judge y faithfulness scoring, Langfuse como backbone, y el emergente evento gen_ai.evaluation.result, que permite colgar el score de alucinación del mismo trace que lo produjo.

Cerramos con una demo en vivo end-to-end. No es una charla 101: asumimos que ya sabés qué es un span, y venimos a mostrarte qué cambia cuando el sistema que observás razona, decide y a veces inventa

Santiago Lator Arias

Observability Program Responsible @Global Processing

La Plata, Argentina

Actions

Please note that Sessionize is not responsible for the accuracy or validity of the data provided by speakers. If you suspect this profile to be fake or spam, please let us know.

Jump to top