FDE中国 · 从业者与关注者的专业知识、实践与行业资料
新手指南
关于
版权说明
FDE
FDE
中国
FDECHINA.ORG
⌕
首页
FDE 观察
阅读路径
企业落地
交付实战
职业发展
生态资源
全部内容
联系我们
工具软件
全部栏目
首页
FDE 观察
阅读路径
企业落地
交付实战
职业发展
生态资源
全部内容
联系我们
工具软件
联系我们
文章
按时间排序
文章
Agents:AI Agent 的系统拆解——规划、工具、失败模式与评测
本文系统拆解 AI Agent 的构成与成败要素:环境与工具清单定义 Agent 的能力边界,规划器与反思机制决定它能否真正完成任务。作者给出计划生成与验证解耦、函数调用机制、规划粒度与控制流选择的完整框架,并归纳规划失败、工具失败与效率三类失败模式及可操作的评测指标,帮助工程师把 Agent 从概念热词落成可交付、可度量的系统。
自有原创
·
FDE中国
·
2025-01-07
文章
LLM-as-a-Judge 完全指南:Critique Shadowing 与评审员构建实操
Hamel Husain 基于帮助 30 多家公司搭建评估系统的经验,给出 LLM-as-a-Judge 的完整构建流程:找到首席领域专家、构建多维数据集、让专家做带批评的通过/不通过判断、迭代构建 LLM 评审并对齐一致率、按维度做错误分析、按需创建专门评审,并用 FAQ 覆盖验证方法、模型选择与微调取舍等常见问题。
自有原创
·
FDE中国
·
2024-10-29
文章
你的 AI 产品需要评测:三层测试体系的开山之文
Hamel Husain 的评测开山之作:AI 产品卡在演示与可用之间的根因,几乎都是没有评测系统。文章以房地产 AI 助手 Lucy 的真实改造为线索,给出单元测试、模型与人工评测、A/B 测试三层体系,并展示评测基础设施如何白送微调数据、合成数据与调试能力。
自有原创
·
FDE中国
·
2024-03-29
文章
哪些 LLM 评测有效,哪些无效:按任务类型的实操盘点
按任务类型盘点真正有效的 LLM 评测:分类用召回/精确率与 ROC-AUC/PR-AUC 及概率分布分离度,摘要用 NLI 微调测事实一致性、用奖励模型测相关性,翻译用 chrF/BLEURT/COMET/COMETKiwi,版权与毒性用 HELM 方法测试;同时解释 ROUGE、G-Eval 等流行指标为何区分度不足,最后讨论人工评估、主动学习与按风险校准评估门槛的务实做法。
自有原创
·
FDE中国
·
2024-03-01
文章分页
上一页
1
…
25
26