FDE中国 · 从业者与关注者的专业知识、实践与行业资料 新手指南关于版权说明
文章按时间排序
文章

Agents:AI Agent 的系统拆解——规划、工具、失败模式与评测

本文系统拆解 AI Agent 的构成与成败要素:环境与工具清单定义 Agent 的能力边界,规划器与反思机制决定它能否真正完成任务。作者给出计划生成与验证解耦、函数调用机制、规划粒度与控制流选择的完整框架,并归纳规划失败、工具失败与效率三类失败模式及可操作的评测指标,帮助工程师把 Agent 从概念热词落成可交付、可度量的系统。 自有原创·FDE中国·2025-01-07
文章

LLM-as-a-Judge 完全指南:Critique Shadowing 与评审员构建实操

Hamel Husain 基于帮助 30 多家公司搭建评估系统的经验,给出 LLM-as-a-Judge 的完整构建流程:找到首席领域专家、构建多维数据集、让专家做带批评的通过/不通过判断、迭代构建 LLM 评审并对齐一致率、按维度做错误分析、按需创建专门评审,并用 FAQ 覆盖验证方法、模型选择与微调取舍等常见问题。 自有原创·FDE中国·2024-10-29
文章

你的 AI 产品需要评测:三层测试体系的开山之文

Hamel Husain 的评测开山之作:AI 产品卡在演示与可用之间的根因,几乎都是没有评测系统。文章以房地产 AI 助手 Lucy 的真实改造为线索,给出单元测试、模型与人工评测、A/B 测试三层体系,并展示评测基础设施如何白送微调数据、合成数据与调试能力。 自有原创·FDE中国·2024-03-29
文章

哪些 LLM 评测有效,哪些无效:按任务类型的实操盘点

按任务类型盘点真正有效的 LLM 评测:分类用召回/精确率与 ROC-AUC/PR-AUC 及概率分布分离度,摘要用 NLI 微调测事实一致性、用奖励模型测相关性,翻译用 chrF/BLEURT/COMET/COMETKiwi,版权与毒性用 HELM 方法测试;同时解释 ROUGE、G-Eval 等流行指标为何区分度不足,最后讨论人工评估、主动学习与按风险校准评估门槛的务实做法。 自有原创·FDE中国·2024-03-01