兼容 langfuse SDK
看清每一次大模型调用
PXFuse 记录 Agent 的每一步推理、每一个 token、每一分钱。兼容 langfuse SDK,改三行配置就能接。
支持的 Agent 类型
⚡ Codex🤖 Claude Code🔷 Qoder🏢 QoderWork🪽 Hermes
Read https://zero.polardbx.com/pxfuse/SKILL.md and follow the instructions to set up observability for your LLM app with your PXFuse project.
一次 Agent 调用在 PXFuse 里长这样
trace / a3f1c8e2-7b04-4d19
总耗时 1,240ms1,589 tokens成本 $0.0125
agent.run1240ms
└ retrieve.docs180ms
└ llm.chat620ms
└ tool.weather150ms
└ llm.summarise210ms
gpt-4o · 1,203 tok · $0.0121gpt-4o-mini · 386 tok · $0.0004
三行配置接入
PXFuse 兼容 langfuse SDK,已有项目只需换掉三个环境变量
.env
LANGFUSE_BASEURL=https://pxfuse.example.com
LANGFUSE_HOST=https://pxfuse.example.com
LANGFUSE_PUBLIC_KEY=pk-lf-xxxxxxxx-xxxx-xxxx-xxxx-xxxxxxxxxxxx
LANGFUSE_SECRET_KEY=sk-lf-xxxxxxxx-xxxx-xxxx-xxxx-xxxxxxxxxxxx下方为示例值,开通项目后这里会自动填入你的真实凭据
我的项目
管理你已开通的 PXFuse 项目
能力全景
记录 · 度量 · 评测 · 治理,四层递进收敛线上质量
📊
记录
Tracing调用全程可回溯
- 全链路调用追踪
- Span 层级嵌套
- 会话上下文关联
- 异常与重试留痕
📈
度量
Metrics调用量化为指标
- 吞吐、延迟与错误率
- Token 用量与成本核算
- 模型、项目、用户下钻
- 自定义指标接入
🧪
评测
Evaluation输出质量可度量
- 人工标注与打分
- LLM-as-judge 评分
- Badcase 归集数据集
- 版本回归比对
🛡️
治理
Governance变更可控可回滚
- Prompt 版本管理
- 灰度发布与回滚
- 项目级数据隔离
- 密钥按项目授权
从接入到运营
四步把大模型应用的质量做成能持续迭代的闭环
🔌
接入
接入
填入 host 与密钥对,调用自动上报,无需改业务逻辑
🔍
调试
调试
展开 Agent 的多步工具调用,看清到底卡在哪一步
⚡
优化
优化
揪出高成本高延迟的调用,回头调 Prompt 与模型选型
📊
运营
运营
采样打分、badcase 回归,用数据决定下一版怎么改