返回工具库

数据分析

Langfuse

面向 LLM 应用的追踪、评估、提示词管理和成本可观测平台。

价格模式可免费试用
中文支持以英文为主
适用平台Web、API

资源介绍

Langfuse 面向构建 LLM 和 Agent 应用的工程团队,提供调用追踪、提示词版本、评估、延迟和成本观测能力。它可以把一次用户请求拆成模型调用、工具调用和检索步骤,帮助团队定位回答质量下降、上下文过长、工具失败和费用上升的原因。对于正在从演示走向生产的 AI 产品,先建立可回放的 trace 和少量人工评估集,通常比单纯增加模型参数更有诊断价值。

接入时要先决定哪些输入、输出和元数据可以保存,给敏感字段做脱敏或采样。提示词版本、模型版本和评估数据要绑定到同一发布记录,避免复盘时无法重现。评估分数不能当成绝对质量证明,仍需要真实用户反馈和人工抽样。自托管方案还要考虑数据存储、权限、保留期和升级,云端方案则要核对数据处理边界和团队访问。

适合什么人

需要调试、评估、版本化和控制 LLM/Agent 应用质量与成本的工程团队。

真实使用场景

追踪一次请求中的模型和工具调用
比较提示词和模型版本的质量
监控延迟、错误率和 token 成本

价格说明

官网提供云端和自托管相关能力,事件量、保留期、团队权限和高级评估功能以当前官方方案为准。

核心特点

LLM trace 与 span
提示词版本管理
数据集与评估
成本和延迟统计
云端或自托管

限制与注意事项

采集 trace 可能包含敏感提示词和用户数据
评估分数需要真实样本和人工复核
自托管需要负责存储、权限和升级

常见问题

Langfuse 解决的是哪类问题?

它主要帮助团队看清 LLM 应用的调用链、质量、延迟和成本,不能替代模型本身或业务监控。

哪些数据不应直接记录?

密码、密钥、个人敏感信息和未脱敏业务内容都应先过滤、脱敏或采样,再决定是否进入 trace。

如何建立可用的评估流程?

从代表性任务集开始,固定评分标准和模型/提示词版本,结合自动指标、人工抽样和线上反馈复盘。

来源与核验

本页关于 Langfuse 的公开产品信息参考以下来源,未实测或未确认的事项另有说明,可以打开原页面核对。最近一次核验时间是 2026-08-14。官网改版后信息可能变化,以官网当前内容为准。

Langfuse 的替代选择

查看全部数据分析

面向开发团队的应用错误追踪、性能监控与问题定位平台

PostHog新收录

集成产品分析、会话回放、功能开关、实验和错误追踪的平台。

OpenRouter新收录

通过统一接口访问并比较多家模型与推理服务的 AI 平台。

查询 Chrome 扩展排行、关键词、发布者和用户指标的平台。

用于定制化数据可视化的 JavaScript 开源库

将数据库转换为无头 CMS、管理后台与即时 API 的开源数据平台

17TRACK新收录

覆盖上千家承运商的全球包裹聚合查询平台,个人查件免费,企业走 API 订阅。

通过命令行安全访问 1Password 密码库与开发凭据

51Tracking专注国际电商物流领域,提供企业级物流查询服务,支持全球1100+家物流商的轨迹追踪。提高客户满意及信任度,优化客户服务,减少客户咨询

泛互联网出海服务平台

外贸知识服务平台

有永久免费档的指纹浏览器,支持 API 与 RPA 自动化