Langfuse实战:给AI Agent装上黑匣子——开源LLM可观测性平台完全指南

为什么AI Agent需要可观测性

传统软件是确定性的:相同输入,相同输出,出问题看日志就能定位。

但AI Agent不一样。它是非确定性系统——同一个用户请求,可能产生完全不同的执行路径。一个基于工具调用的Agent,在单次请求中可能调用5到20次LLM、动态选择工具、检索数据、调用子Agent,单次成本从$0.001到$2.50不等。

当这样的Agent上了生产,传统的APM(应用性能监控)工具完全失效,因为它们的设计前提是确定性执行。你会遇到这些在开发环境从没出现过的问题:

要解决这些问题,你需要一个LLM原生的可观测性平台。2026年,最主流的开源选择就是 Langfuse。


Langfuse是什么

Langfuse是一个开源的LLM工程平台,为大模型应用和Agent提供完整的可观测性能力。它捕捉每一次LLM交互的细节——输入提示词、输出结果、token数量、延迟、成本和元数据,并以结构化界面呈现,用于调试和分析。

业界常把它比作"LLM应用的Datadog"或"LLM应用的Mixpanel"。

基本信息

维度 详情
定位 开源LLM工程/可观测性平台
许可证 MIT(核心开源)
部署方式 自托管(Docker)+ 托管云双选项
当前版本 v3
SDK Python 4.x / JS / TS
接入标准 原生SDK + OpenTelemetry
框架支持 LangGraph、OpenAI Agents、CrewAI、Pydantic AI、n8n等

四大支柱

Langfuse的能力可以归纳为四个支柱:

  1. Tracing(追踪):记录Agent每一步的完整执行链路
  2. Evaluation(评估):量化Agent输出质量,防止回归
  3. Prompt Management(提示词管理):版本化、团队协作、A/B测试
  4. Cost(成本):按维度归因token消耗和费用

与竞品对比

平台 开源/自托管 框架支持 定位 厂商锁定
Langfuse ✅ MIT,可自托管 广(OTEL+原生SDK) 中立默认选项
LangSmith ❌ 闭源 LangChain原生 LangChain生态 较强
Helicone ✅ 可自托管 代理网关模式 轻量接入
Arize Phoenix ✅ Phoenix OSS OpenInference 企业级评估

Langfuse的核心优势:开源自托管 + 托管云双选项 + 框架支持广 + 无厂商锁定——这让它成为既要可观测性、又不想被锁定的团队的安全默认选择。


五大应用场景

场景一:分布式追踪——还原Agent执行链路

这是Langfuse最核心的能力。每个用户请求生成一棵trace树:根节点是用户消息,子节点是LLM调用、工具调用、检索和子Agent调用。

trace记录的关键信息:请求ID、模型名称、提示词文本、响应文本、时间戳、持续时长。一个trace可能跨越多个跳转(路由器、推理服务器、后处理器),trace树清晰展示时间到底花在了哪里

典型的Agent trace结构:

trace: 用户查询"帮我分析这份销售数据"
├─ llm_call (规划,1240 tokens, $0.038, 1.2s)
├─ tool: query_database (320ms)
├─ tool: generate_chart (失败,重试×2)
├─ llm_call (总结,890 tokens, $0.024, 0.8s)
└─ 总计: 4次调用, $0.062, 6.3s

有了这样的追踪,当Agent出问题时,你能立即看到是哪一步失败、为什么慢、钱花在了哪。

场景二:评估体系——三层评估防回归

Langfuse提出了三层评估体系,这是可靠Agent的基础:

评估层 对象 方法
单步评估(Unit Eval) 离散的单个步骤 断言式检查(如工具调用参数是否正确)
LLM-as-Judge回归测试 主观输出质量 用另一个LLM打分
生产trace采样 真实世界漂移 持续采样生产数据评估

核心工作流是 Dataset + Experiment

  1. 把一组用户提示词存为Langfuse的Dataset
  2. 用这些提示词运行Agent,追踪行为(Experiment)
  3. 基于结果改进,再跑一遍流水线对比

这样每一次提示词调整、模型替换、配置变更都成为一次可量化的实验,避免"改了一处,坏了另一处"的回归问题。Langfuse还支持把评估集成到CI/CD管线,每次变更都带着证据上线。

场景三:提示词管理——版本化与团队协作

提示词是Agent的"源代码",但很多团队还在用硬编码字符串管理它。Langfuse提供:

这意味着你可以在不改代码、不重新部署的情况下迭代提示词,并用真实数据验证效果。

场景四:成本与Token归因

Agent的成本爆炸往往源于不可预测的调用链。Langfuse在同一个分析空间里呈现:traces、observations、cost、tokens、latency、time-to-first-token、prompts、prompt版本、models、评估分数。

你可以按用户、模型、会话等维度做成本归因,快速回答: - 哪个用户/部门消耗了最多token? - 哪个模型的性价比最高? - 哪次发布导致了成本飙升?

场景五:生产监控与告警

Langfuse捕捉那些传统APM发现不了的问题:

配合告警,可以在问题变成事故前就介入。


部署实战

自托管(Docker Compose)

Langfuse v3 支持完整的自托管,适合对数据隐私有要求的团队:

# 克隆仓库
git clone https://github.com/langfuse/langfuse.git
cd langfuse

# 启动(包含 PostgreSQL + ClickHouse + Redis)
docker compose up -d

# 默认访问 http://localhost:3000

Langfuse v3 的架构包含: - PostgreSQL:存储元数据 - ClickHouse:存储大规模trace数据(高性能分析) - Redis:缓存和队列

SDK接入(Python)

from langfuse import Langfuse
from langfuse.decorators import observe

# 初始化
langfuse = Langfuse(
    public_key="pk-lf-...",
    secret_key="sk-lf-...",
    host="http://localhost:3000"  # 自托管地址
)

# 用装饰器自动追踪
@observe()
def my_agent(query: str):
    # 你的Agent逻辑
    result = call_llm(query)
    return result

与vLLM配合的本地化方案

如果你用vLLM跑本地模型,可以把Langfuse和vLLM组合成完全本地化的可观测方案——模型推理在vLLM,调用追踪在自托管Langfuse,数据完全不出企业。这对国内有数据合规要求的场景特别有价值。

国内部署考量


框架集成示例

Langfuse原生支持主流Agent框架,接入成本极低。

OpenAI SDK(一行替换)

最简单的集成——只改一个import:

# 原来
# from openai import OpenAI

# 改成 Langfuse 的 drop-in 替代
from langfuse.openai import OpenAI

client = OpenAI()
# 之后所有调用自动被追踪,无需改其他代码

LangGraph

from langfuse.callback import CallbackHandler

langfuse_handler = CallbackHandler()

# 在调用时传入 callback
graph.invoke(
    {"messages": [("user", "分析这份报告")]},
    config={"callbacks": [langfuse_handler]}
)

CrewAI

CrewAI通过OpenTelemetry与Langfuse集成,追踪多Agent团队中每个Agent的角色、工具调用和协作过程。

通用接入:OpenTelemetry

如果你的框架不在原生支持列表中,可以通过OpenTelemetry接入——这是Langfuse保持"框架中立"的关键。任何支持OTEL的系统都能把trace发给Langfuse。

无代码/RAG平台集成

除了代码框架,Langfuse也深度支持无代码LLM应用平台和RAG框架,这对国内团队尤其友好:

如果你之前用过 Dify 或 WeKnora 搭建RAG/Agent应用,接入Langfuse几乎是零成本的升级——把"能跑"变成"可观测、可优化"。


企业级落地案例

Oracle:多Agent系统可观测

Oracle在其AI数据科学博客中明确指出,Langfuse为AI应用提供追踪、可观测性、评估和成本可见性。在企业AI中,它成为让系统"可追溯、可度量、可改进"的操作层。

IBM watsonx Orchestrate集成

IBM提供了将Langfuse与watsonx Orchestrate集成的教程,结合后者的结构化平台(支持自托管、工具推理、API调用和企业级控制),增强Agent可观测性,无需编写自定义编排代码。

Agentic Data Stack(开源全栈方案)

ClickHouse构建的开源自托管栈,把聊天UI(LibreChat)通过MCP连接到数据(ClickHouse),由Langfuse提供完整的LLM可观测性——docker compose up一键部署。这是一个很好的"开箱即用"参考架构。


Build vs Buy:自托管 vs 托管云

维度 自托管 托管云
数据控制 完全 依赖厂商
部署成本 需运维 零运维
合规适配 强(数据不出境) 看厂商
扩展性 自己负责 厂商负责
适合团队 有DevOps能力、合规要求高 快速起步、小团队

选型建议

Langfuse的最大价值在于两条路都给你留着——先用托管云起步,规模和合规要求上来后无缝切换到自托管,不存在厂商锁定。


总结

当AI Agent从Demo走向生产,可观测性不是锦上添花,而是上生产线的必备能力。

Langfuse之所以成为2026年的主流选择,核心原因有三:

  1. LLM原生:专为非确定性的Agent系统设计,传统APM做不到
  2. 开源中立:MIT许可、自托管可选、框架支持广、无厂商锁定
  3. 闭环完整:追踪→评估→提示词管理→成本,覆盖AI工程的完整生命周期

如果你正在把Agent推向生产,或者已经被"线上为什么出问题说不清"困扰,Langfuse是值得优先评估的工具。先用Docker在本地跑一个实例,接入你现有的Agent,你会立刻看到那些之前看不见的东西。


参考文献

  1. Langfuse官方文档. https://langfuse.com/docs
  2. Langfuse, "AI Agent Observability, Tracing & Evaluation with Langfuse". https://langfuse.com/blog/2024-07-ai-agent-observability-with-langfuse
  3. Oracle, "Observability for Multi Agent Systems", 2026. https://blogs.oracle.com/ai-and-datascience/observability-for-multi-agent-systems
  4. IBM, "Enhance AI Agent Observability with Langfuse using watsonx Orchestrate". https://www.ibm.com/think/tutorials/ai-agent-observability-langfuse-watsonx-orchestrate
  5. jangwook.net, "Langfuse v3 Self-Hosting Complete Guide", 2026. https://jangwook.net/en/blog/en/langfuse-self-hosted-llm-tracing-setup-guide-2026
  6. PyImageSearch, "LLM Observability with Self-Hosted Langfuse and vLLM", May 2026. https://pyimagesearch.com/2026/05/18/llm-observability-with-self-hosted-langfuse-and-vllm/
  7. guptadeepak.com, "Top 5 LLM Observability Platforms 2026: Langfuse vs LangSmith vs Helicone vs Arize". https://guptadeepak.com/tools/top-5-llm-observability-platforms-2026/
  8. Digital Applied, "Agent Observability Platforms: LangSmith, Langfuse, Arize 2026". https://www.digitalapplied.com/blog/agent-observability-platforms-langsmith-langfuse-arize-2026
  9. Langfuse, "Observability for CrewAI with Langfuse Integration". https://langfuse.com/integrations/frameworks/crewai
  10. Langfuse, "Open Source Observability for LangGraph". https://langfuse.com/guides/cookbook/integration_langgraph
  11. Langfuse, "Agentic Data Stack: LibreChat + ClickHouse + Langfuse". https://langfuse.com/integrations/agentic-data-stack
  12. Spheron, "LLM Observability on GPU Cloud: Deploy Langfuse, Arize Phoenix, and Helicone", 2026. https://www.spheron.network/blog/llm-observability-gpu-cloud-langfuse-arize-phoenix-helicone/
  13. Langfuse, "Observability and tracing for Dify". https://langfuse.com/integrations/no-code/dify
  14. Dify官方文档, "Integrate with Langfuse". https://docs.dify.ai/en/guides/monitoring/integrate-external-ops-tools/integrate-langfuse

相关阅读:AI Agent治理与可观测性:企业落地的隐藏成本 | 企业AI Agent部署实战 | Dify vs Coze vs RAGFlow 对比 | WeKnora vs Dify vs RAGFlow 对比

🛒 京东 挑好物逛京东(B组)

京东大促进行中,超值好物等你来选

去京东看看 →

* 京东联盟推广链接,你不需要多花钱,我们获得小额佣金

🟠 淘宝 淘宝数码家电会场

淘宝精选好物,超值优惠等你来抢

去淘宝看看 →

* 淘宝联盟推广链接,你不需要多花钱,我们获得小额佣金

🛒

推荐搭配装备

善其事,利其器。以下硬件能最大化你的AI体验👇

京东
MacBook Pro 14寸 M4 Pro
AI开发者首选笔记本,性能续航双优
¥15000-20000
淘宝
联想拯救者Y9000P 2026
AI开发游戏本,i9+RTX4070
¥9000-12000
🔵 京东 🟠 淘宝

🔗 通过以上链接购买可支持本站持续运营 🙏