FDE中国 · 从业者与关注者的专业知识、实践与行业资料 新手指南关于版权说明
文章按时间排序
文章

工具档案:OpenAI Evals——FDE 交付里的第一块评测底座

OpenAI Evals 是 OpenAI 官方开源的大模型评测框架,用统一的评估器与注册表结构批量跑 prompt 与模型对比,是很多团队搭建 LLM 评测体系时的第一块底座。在 Forward Deployed Engineer(FDE,前置部署工程师)交付里,它最适合用在进场初期的基线建立阶段:把客户场景中最有代表性的 20-50 个真实案例固化成 eval 用例,跑出基线分数,之后每次改 自有原创·FDE中国·2026-08-18
文章

工具档案:OpenAI Agents SDK——把 agent 从原型推向生产的官方框架

OpenAI Agents SDK 是 OpenAI 官方的 agent 构建框架,内置 handoffs(任务移交)、guardrails(护栏)与 tracing,定位是 agent 从原型走向生产的官方路径。在 Forward Deployed Engineer(FDE,前置部署工程师)交付里,当客户技术栈锚定 OpenAI 模型时,它往往是首选:官方维护、能力与模型同步演进,guardra 自有原创·FDE中国·2026-08-16
文章

工具档案:vLLM——私有化交付里的高吞吐推理引擎

vLLM 是高吞吐的 LLM 推理服务引擎,也是自托管模型部署的事实标准之一。在 Forward Deployed Engineer(FDE,前置部署工程师)交付里,它主要出现在私有化项目的部署与压测阶段:在客户内网把开源或国产模型跑成稳定服务,配置并行策略、量化方案与吞吐基线,直接决定客户对「这套系统能不能用」的第一印象;性能不达标时,FDE 也要能判断瓶颈在推理配置还是应用层。 自有原创·FDE中国·2026-08-15
文章

工具档案:Model Context Protocol(MCP)——FDE 交付的事实标准连接层

Model Context Protocol(MCP)是 Anthropic 发起的工具与上下文开放协议,用统一接口把外部系统接给模型,已成为 Forward Deployed Engineer(FDE,前置部署工程师)交付生态的事实标准连接层。在 FDE 交付里,集成阶段几乎绕不开它:客户的数据库、内部 API、常用 SaaS 工具,要么已有现成的 MCP server 可接,要么你按协议自己封 自有原创·FDE中国·2026-08-13
文章

工具档案:promptfoo——CLI 优先的 prompt 测试与红队工具

promptfoo 是开源、CLI 优先的 prompt 与 agent 测试工具,并内置红队测试能力,被第三方对比评测列为上手门槛最低的选项之一。在 Forward Deployed Engineer(FDE,前置部署工程师)交付里,它适合进场头几周就引入:把客户场景的 prompt 变体写成测试矩阵接进 CI 做回归,每次改版自动跑一遍;交付前的安全与越权检查,也可以先用它的红队能力扫一轮,再 自有原创·FDE中国·2026-08-06
文章

工具档案:Arize Phoenix——面向 agent 过程评测的开源可观测工具

Arize Phoenix 是开源的 LLM 可观测与评测工具,agent 评测能力突出,商业版为 Arize AX(第三方社区对比口径)。在 Forward Deployed Engineer(FDE,前置部署工程师)交付里,它适合在 agent 型项目里承担「过程评测」:不只看最终答案对不对,还看工具调用序列、检索质量、每一步的延迟与成本,适合需要向客户解释「系统错在哪一步」的交付场景,也常用 自有原创·FDE中国·2026-08-04
文章

工具档案:Langfuse——开源自托管的 LLM 可观测与评测平台

Langfuse 是开源的 LLM 可观测性与评测平台,提供 tracing、prompt 管理、评测与分析能力,主打数据主权与自托管。在 Forward Deployed Engineer(FDE,前置部署工程师)交付里,它常被用作私有化项目的观测底座:客户数据不出内网时,自托管 Langfuse 接住 agent 每一次调用的 trace,再挂上评测集做线上回归;这也是国内团队在「日志不能送海 自有原创·FDE中国·2026-08-04
文章

工具档案:LangSmith——与 LangGraph 绑定最紧的官方评测观测平台

LangSmith 是 LangChain 官方的可观测与评测平台,与 LangGraph 编排的工作流结合最紧密(第三方社区对比口径)。在 Forward Deployed Engineer(FDE,前置部署工程师)交付里,当客户或你自己的技术栈用 LangGraph 搭多 agent 流程时,它是最顺的配套:开发期定位哪一步 agent 走偏,上线后跟踪延迟与失败率,评测集直接挂在节点上跑回归 自有原创·FDE中国·2026-07-31
文章

工具档案:Braintrust——支持自托管的产品化评测平台

Braintrust 是产品化的 LLM 评测与观测平台,覆盖数据集管理、评分器、实验对比,并支持自托管部署;其 2026 年的自托管评测工具横评覆盖 Langfuse、Phoenix、DeepEval、promptfoo、Fiddler 等主流选项(厂商内容,引用注意口径)。在 Forward Deployed Engineer(FDE,前置部署工程师)交付里,它适合用在客户对评测有正式要求的项 自有原创·FDE中国·2026-07-30
文章

工具档案:Claude Agent SDK——与 Claude Code 同源的 agent 开发套件

Claude Agent SDK 是 Anthropic 官方的 agent 开发套件,与 Claude Code 同源,把 agentic coding 验证过的工程能力(代码执行、工具编排、权限控制)开放给自建应用。在 Forward Deployed Engineer(FDE,前置部署工程师)交付里,它适合两类场景:给客户搭以代码执行为核心的 agent(数据处理、报表生成、内部系统操作), 自有原创·FDE中国·2026-07-29