Langfuse实战:给AI Agent装上黑匣子——开源LLM可观测性平台完全指南
为什么AI Agent需要可观测性
传统软件是确定性的:相同输入,相同输出,出问题看日志就能定位。
但AI Agent不一样。它是非确定性系统——同一个用户请求,可能产生完全不同的执行路径。一个基于工具调用的Agent,在单次请求中可能调用5到20次LLM、动态选择工具、检索数据、调用子Agent,单次成本从$0.001到$2.50不等。
当这样的Agent上了生产,传统的APM(应用性能监控)工具完全失效,因为它们的设计前提是确定性执行。你会遇到这些在开发环境从没出现过的问题:
- 模型漂移:同样的提示词,效果慢慢变差
- 工具重试循环:Agent卡在某个工具调用上反复重试
- 提示词回归:升级框架后,原本好用的提示词突然不灵了
- 成本飙升:某个失控的循环把token烧到天价
要解决这些问题,你需要一个LLM原生的可观测性平台。2026年,最主流的开源选择就是 Langfuse。
Langfuse是什么
Langfuse是一个开源的LLM工程平台,为大模型应用和Agent提供完整的可观测性能力。它捕捉每一次LLM交互的细节——输入提示词、输出结果、token数量、延迟、成本和元数据,并以结构化界面呈现,用于调试和分析。
业界常把它比作"LLM应用的Datadog"或"LLM应用的Mixpanel"。
基本信息
| 维度 | 详情 |
|---|---|
| 定位 | 开源LLM工程/可观测性平台 |
| 许可证 | MIT(核心开源) |
| 部署方式 | 自托管(Docker)+ 托管云双选项 |
| 当前版本 | v3 |
| SDK | Python 4.x / JS / TS |
| 接入标准 | 原生SDK + OpenTelemetry |
| 框架支持 | LangGraph、OpenAI Agents、CrewAI、Pydantic AI、n8n等 |
四大支柱
Langfuse的能力可以归纳为四个支柱:
- Tracing(追踪):记录Agent每一步的完整执行链路
- Evaluation(评估):量化Agent输出质量,防止回归
- Prompt Management(提示词管理):版本化、团队协作、A/B测试
- Cost(成本):按维度归因token消耗和费用
与竞品对比
| 平台 | 开源/自托管 | 框架支持 | 定位 | 厂商锁定 |
|---|---|---|---|---|
| Langfuse | ✅ MIT,可自托管 | 广(OTEL+原生SDK) | 中立默认选项 | 无 |
| LangSmith | ❌ 闭源 | LangChain原生 | LangChain生态 | 较强 |
| Helicone | ✅ 可自托管 | 代理网关模式 | 轻量接入 | 弱 |
| Arize Phoenix | ✅ Phoenix OSS | OpenInference | 企业级评估 | 中 |
Langfuse的核心优势:开源自托管 + 托管云双选项 + 框架支持广 + 无厂商锁定——这让它成为既要可观测性、又不想被锁定的团队的安全默认选择。
五大应用场景
场景一:分布式追踪——还原Agent执行链路
这是Langfuse最核心的能力。每个用户请求生成一棵trace树:根节点是用户消息,子节点是LLM调用、工具调用、检索和子Agent调用。
trace记录的关键信息:请求ID、模型名称、提示词文本、响应文本、时间戳、持续时长。一个trace可能跨越多个跳转(路由器、推理服务器、后处理器),trace树清晰展示时间到底花在了哪里。
典型的Agent trace结构:
trace: 用户查询"帮我分析这份销售数据"
├─ llm_call (规划,1240 tokens, $0.038, 1.2s)
├─ tool: query_database (320ms)
├─ tool: generate_chart (失败,重试×2)
├─ llm_call (总结,890 tokens, $0.024, 0.8s)
└─ 总计: 4次调用, $0.062, 6.3s
有了这样的追踪,当Agent出问题时,你能立即看到是哪一步失败、为什么慢、钱花在了哪。
场景二:评估体系——三层评估防回归
Langfuse提出了三层评估体系,这是可靠Agent的基础:
| 评估层 | 对象 | 方法 |
|---|---|---|
| 单步评估(Unit Eval) | 离散的单个步骤 | 断言式检查(如工具调用参数是否正确) |
| LLM-as-Judge回归测试 | 主观输出质量 | 用另一个LLM打分 |
| 生产trace采样 | 真实世界漂移 | 持续采样生产数据评估 |
核心工作流是 Dataset + Experiment:
- 把一组用户提示词存为Langfuse的Dataset
- 用这些提示词运行Agent,追踪行为(Experiment)
- 基于结果改进,再跑一遍流水线对比
这样每一次提示词调整、模型替换、配置变更都成为一次可量化的实验,避免"改了一处,坏了另一处"的回归问题。Langfuse还支持把评估集成到CI/CD管线,每次变更都带着证据上线。
场景三:提示词管理——版本化与团队协作
提示词是Agent的"源代码",但很多团队还在用硬编码字符串管理它。Langfuse提供:
- 版本化:每个提示词都有版本历史,可回滚
- 团队协作编辑:非工程师(产品、运营)也能编辑提示词
- 与trace关联:每条trace都记录用了哪个版本的提示词
- A/B测试:对比不同提示词版本的实际效果
这意味着你可以在不改代码、不重新部署的情况下迭代提示词,并用真实数据验证效果。
场景四:成本与Token归因
Agent的成本爆炸往往源于不可预测的调用链。Langfuse在同一个分析空间里呈现:traces、observations、cost、tokens、latency、time-to-first-token、prompts、prompt版本、models、评估分数。
你可以按用户、模型、会话等维度做成本归因,快速回答: - 哪个用户/部门消耗了最多token? - 哪个模型的性价比最高? - 哪次发布导致了成本飙升?
场景五:生产监控与告警
Langfuse捕捉那些传统APM发现不了的问题:
- 模型漂移:输出质量随时间下降
- 工具重试循环:Agent卡在某步反复重试
- 提示词回归:框架升级后提示词失效
- 失控循环:导致成本暴涨的无限循环
配合告警,可以在问题变成事故前就介入。
部署实战
自托管(Docker Compose)
Langfuse v3 支持完整的自托管,适合对数据隐私有要求的团队:
# 克隆仓库
git clone https://github.com/langfuse/langfuse.git
cd langfuse
# 启动(包含 PostgreSQL + ClickHouse + Redis)
docker compose up -d
# 默认访问 http://localhost:3000
Langfuse v3 的架构包含: - PostgreSQL:存储元数据 - ClickHouse:存储大规模trace数据(高性能分析) - Redis:缓存和队列
SDK接入(Python)
from langfuse import Langfuse
from langfuse.decorators import observe
# 初始化
langfuse = Langfuse(
public_key="pk-lf-...",
secret_key="sk-lf-...",
host="http://localhost:3000" # 自托管地址
)
# 用装饰器自动追踪
@observe()
def my_agent(query: str):
# 你的Agent逻辑
result = call_llm(query)
return result
与vLLM配合的本地化方案
如果你用vLLM跑本地模型,可以把Langfuse和vLLM组合成完全本地化的可观测方案——模型推理在vLLM,调用追踪在自托管Langfuse,数据完全不出企业。这对国内有数据合规要求的场景特别有价值。
国内部署考量
- ClickHouse和PostgreSQL都可部署在阿里云/腾讯云/华为云
- 自托管方案确保trace数据(可能包含敏感业务信息)不出境,满足《数据安全法》要求
- 配合本地模型(Qwen/DeepSeek/GLM)可实现全链路国产化
框架集成示例
Langfuse原生支持主流Agent框架,接入成本极低。
OpenAI SDK(一行替换)
最简单的集成——只改一个import:
# 原来
# from openai import OpenAI
# 改成 Langfuse 的 drop-in 替代
from langfuse.openai import OpenAI
client = OpenAI()
# 之后所有调用自动被追踪,无需改其他代码
LangGraph
from langfuse.callback import CallbackHandler
langfuse_handler = CallbackHandler()
# 在调用时传入 callback
graph.invoke(
{"messages": [("user", "分析这份报告")]},
config={"callbacks": [langfuse_handler]}
)
CrewAI
CrewAI通过OpenTelemetry与Langfuse集成,追踪多Agent团队中每个Agent的角色、工具调用和协作过程。
通用接入:OpenTelemetry
如果你的框架不在原生支持列表中,可以通过OpenTelemetry接入——这是Langfuse保持"框架中立"的关键。任何支持OTEL的系统都能把trace发给Langfuse。
无代码/RAG平台集成
除了代码框架,Langfuse也深度支持无代码LLM应用平台和RAG框架,这对国内团队尤其友好:
- Dify:原生集成Langfuse。在Dify应用的「监控」侧边栏选择「Tracing应用性能」,简单配置即可接入,无需改任何代码就能看到成本、延迟和质量数据。这是国内团队用得最多的组合之一
- WeKnora(腾讯开源RAG框架):可通过OpenTelemetry标准接入Langfuse,实现对检索链路和生成质量的追踪
- 其他:Langflow(v1.0.17+原生)、OpenWebUI、Amazon Bedrock AgentCore(OTEL兼容)等
如果你之前用过 Dify 或 WeKnora 搭建RAG/Agent应用,接入Langfuse几乎是零成本的升级——把"能跑"变成"可观测、可优化"。
企业级落地案例
Oracle:多Agent系统可观测
Oracle在其AI数据科学博客中明确指出,Langfuse为AI应用提供追踪、可观测性、评估和成本可见性。在企业AI中,它成为让系统"可追溯、可度量、可改进"的操作层。
IBM watsonx Orchestrate集成
IBM提供了将Langfuse与watsonx Orchestrate集成的教程,结合后者的结构化平台(支持自托管、工具推理、API调用和企业级控制),增强Agent可观测性,无需编写自定义编排代码。
Agentic Data Stack(开源全栈方案)
ClickHouse构建的开源自托管栈,把聊天UI(LibreChat)通过MCP连接到数据(ClickHouse),由Langfuse提供完整的LLM可观测性——docker compose up一键部署。这是一个很好的"开箱即用"参考架构。
Build vs Buy:自托管 vs 托管云
| 维度 | 自托管 | 托管云 |
|---|---|---|
| 数据控制 | 完全 | 依赖厂商 |
| 部署成本 | 需运维 | 零运维 |
| 合规适配 | 强(数据不出境) | 看厂商 |
| 扩展性 | 自己负责 | 厂商负责 |
| 适合团队 | 有DevOps能力、合规要求高 | 快速起步、小团队 |
选型建议:
- 小团队/快速验证 → 托管云,零运维快速起步
- 中大型企业/合规要求 → 自托管,数据完全可控
- 国内政企/信创 → 自托管 + 本地模型,全链路国产化
Langfuse的最大价值在于两条路都给你留着——先用托管云起步,规模和合规要求上来后无缝切换到自托管,不存在厂商锁定。
总结
当AI Agent从Demo走向生产,可观测性不是锦上添花,而是上生产线的必备能力。
Langfuse之所以成为2026年的主流选择,核心原因有三:
- LLM原生:专为非确定性的Agent系统设计,传统APM做不到
- 开源中立:MIT许可、自托管可选、框架支持广、无厂商锁定
- 闭环完整:追踪→评估→提示词管理→成本,覆盖AI工程的完整生命周期
如果你正在把Agent推向生产,或者已经被"线上为什么出问题说不清"困扰,Langfuse是值得优先评估的工具。先用Docker在本地跑一个实例,接入你现有的Agent,你会立刻看到那些之前看不见的东西。
参考文献
- Langfuse官方文档. https://langfuse.com/docs
- Langfuse, "AI Agent Observability, Tracing & Evaluation with Langfuse". https://langfuse.com/blog/2024-07-ai-agent-observability-with-langfuse
- Oracle, "Observability for Multi Agent Systems", 2026. https://blogs.oracle.com/ai-and-datascience/observability-for-multi-agent-systems
- IBM, "Enhance AI Agent Observability with Langfuse using watsonx Orchestrate". https://www.ibm.com/think/tutorials/ai-agent-observability-langfuse-watsonx-orchestrate
- jangwook.net, "Langfuse v3 Self-Hosting Complete Guide", 2026. https://jangwook.net/en/blog/en/langfuse-self-hosted-llm-tracing-setup-guide-2026
- PyImageSearch, "LLM Observability with Self-Hosted Langfuse and vLLM", May 2026. https://pyimagesearch.com/2026/05/18/llm-observability-with-self-hosted-langfuse-and-vllm/
- guptadeepak.com, "Top 5 LLM Observability Platforms 2026: Langfuse vs LangSmith vs Helicone vs Arize". https://guptadeepak.com/tools/top-5-llm-observability-platforms-2026/
- Digital Applied, "Agent Observability Platforms: LangSmith, Langfuse, Arize 2026". https://www.digitalapplied.com/blog/agent-observability-platforms-langsmith-langfuse-arize-2026
- Langfuse, "Observability for CrewAI with Langfuse Integration". https://langfuse.com/integrations/frameworks/crewai
- Langfuse, "Open Source Observability for LangGraph". https://langfuse.com/guides/cookbook/integration_langgraph
- Langfuse, "Agentic Data Stack: LibreChat + ClickHouse + Langfuse". https://langfuse.com/integrations/agentic-data-stack
- Spheron, "LLM Observability on GPU Cloud: Deploy Langfuse, Arize Phoenix, and Helicone", 2026. https://www.spheron.network/blog/llm-observability-gpu-cloud-langfuse-arize-phoenix-helicone/
- Langfuse, "Observability and tracing for Dify". https://langfuse.com/integrations/no-code/dify
- Dify官方文档, "Integrate with Langfuse". https://docs.dify.ai/en/guides/monitoring/integrate-external-ops-tools/integrate-langfuse
相关阅读:AI Agent治理与可观测性:企业落地的隐藏成本 | 企业AI Agent部署实战 | Dify vs Coze vs RAGFlow 对比 | WeKnora vs Dify vs RAGFlow 对比
推荐搭配装备
善其事,利其器。以下硬件能最大化你的AI体验👇
🔗 通过以上链接购买可支持本站持续运营 🙏