Agent Observability: así ves lo que tu AI-Agent realmente hace

Agent Observability: Traces, métricas y Evals para runs no deterministas. Langfuse 34.000 estrellas, enero 2026 ClickHouse. Phoenix, LangSmith, OpenTelemetry.

por Data McGrinseyRead in EnglishAuf Deutsch lesen用中文读
Agent Observability: así ves lo que tu AI-Agent realmente haceGenerado artificialmente
Generado artificialmenteGenerado artificialmenteEl artículo 50 de la Ley de IA exige que el contenido de imagen, audio y vídeo generado artificialmente esté marcado de forma reconocible y legible por máquina. El símbolo es el icono base oficial de la Comisión Europea. Usarlo es voluntario, la obligación de marcar no lo es.Generado por máquina: Texto · Imagen. Con dirección humana.McGrinsey Living Intelligence SystemsMcGrinsey Living Intelligence SystemsLI: inteligencia viva de todo tipo. McGrinsey junta la inteligencia de siempre y la inteligencia nueva en sistemas de inteligencia viva. Esos sistemas simbióticos de máquina y persona trabajan juntos para entregar el destilado más fino, para cada inteligencia.

Agent Observability significa: ver cada LLM-Call, Tool-Call, Retry y token de una ejecución, después y durante. El APM clásico registra una ruta determinista. Un agente no es determinista. El mismo prompt, otro grafo. Sin traces te quedas mirando la última frase y adivinas.

Diagrama de flujo: Observability-Tools en torno a una Agent-Runtime, Traces, métricas, Debugging
El anillo alrededor del runtime: traces, métricas, debugging. En el dibujo original aparecen LangSmith, LangGraph Studio, Langfuse, AgentOps. Phoenix y OpenTelemetry pertenecen ahora al mismo anillo.

Lo que miras en absoluto

  • Traces: todo el camino de una solicitud, anidado como muñecas: modelo, tool, subagente, retry.
  • Métricas: Tokens, latencia por paso, coste por request, tasa de error.
  • Evals: si esta ejecución hizo el trabajo, valorado por un judge, un script o una persona.

El tubo bajo los nombres de marca es cada vez más OpenTelemetry. Langfuse y Phoenix lo hablan de forma nativa. LangSmith puede tragarlo. Quien instrumenta una vez contra OTel puede cambiar el backend después.

El campo en septiembre de 2026

Langfuse: default, si los datos deben quedarse contigo

Plataforma open source de ingeniería LLM, MIT, self-host por Docker. Tracing, versiones de prompts, datasets, playground, evals. Unos 34.000 estrellas de GitHub en langfuse/langfuse. Desde enero de 2026 la empresa está en ClickHouse. El README sigue manteniendo MIT y self-host. El trade: madurez más un vendor de base de datos como propietario. Pregunta dónde aterrizan los traces.

Fuente: github.com/langfuse/langfuse.

LangSmith: el más profundo si ya vives en LangChain

Construido por el equipo de LangChain. Waterfall-traces, dashboards de tokens y latencia, Prompt Hub. Junto a ello LangGraph Studio como debugger visual: el grafo se ilumina, pausa, rebobinar, volver a ejecutar un production-trace en local. Los docs públicos de 2026 tratan LangSmith todavía como producto cloud, no como una caja en tu casa. Está bien si los prompts pueden salir de casa. No está bien si no.

Fuente: docs.smith.langchain.com.

Arize Phoenix: OpenTelemetry en el portátil

Tracing más evals, notebook-first, los mismos spans después en production. GitHub lista unos 11.000 estrellas en arize-ai/phoenix. Licencia en el repo: Elastic-2.0, source-available, no MIT. Self-host es el punto. La hermana gestionada se llama Arize AX.

Fuente: github.com/Arize-ai/phoenix.

AgentOps, Helicone, Weave, Opik

AgentOps trata la agent-session como objeto, no el LLM-call individual. Helicone se sienta como proxy y cuenta. Weights & Biases Weave es la capa de traces si de todos modos pagas W&B. Comet Opik es el otro banco abierto de eval y trace. Ninguno de ellos reemplaza un trace-store. Es solo la entrada que toman algunos equipos.

Tres preguntas, luego eliges

  1. ¿Pueden los prompts salir de tus máquinas? No: Langfuse o Phoenix, self-hosted. Sí: LangSmith está sobre la mesa.
  2. ¿Estás casado con LangGraph? Sí: LangSmith más Studio. No: primero framework-agnóstico.
  3. ¿Debugger para el martes o Monitor para el año que viene? Studio gana la tarde. Langfuse y LangSmith ganan el mes.

La mayoría de los equipos terminan en dos capas: una para recorrer un grafo, una para production-traces. Eso no es un empate. Los trabajos son distintos.

Tabla de hechos

AfirmaciónCestaDe dónde
Langfuse unas 34.000 estrellas en GitHub, MIT, Self-Host, desde enero de 2026 parte de ClickHouseHechogithub.com/langfuse/langfuse README, septiembre de 2026. La adquisición aparece ahí del propio proyecto.
Phoenix unas 11.000 estrellas, Elastic-2.0, Self-Host, OpenTelemetry/OpenInferenceHechogithub.com/Arize-ai/phoenix, septiembre de 2026.
LangSmith es Cloud, no una caja Self-HostHecho según la documentación pública, septiembre de 2026LangSmith-Docs. Si eso cambia, primero cambian los docs.
Las ejecuciones de agentes no son deterministas, por eso los traces en production no son opcionalesTesisEsta página. El mismo input, otro camino es todo el punto de un agente.
OpenTelemetry es el formato de intercambio que sobrevive a los nombres de marca actualesHipótesisLangfuse y Phoenix OTel nativo, LangSmith Ingestion. Dirección, no un acuerdo de estándar.

Corte: 9 de septiembre de 2026. Langfuse ya no es una empresa independiente. Los traces siguen en self-host bajo MIT si tú montas la caja tú mismo.