FDE中国 · 从业者与关注者的专业知识、实践与行业资料 新手指南关于版权说明
文章按时间排序
文章

用并行 Agent 团队写一个 C 编译器:测试 harness 与文件锁的实战

Anthropic 研究员用 16 个并行 Claude Agent、近 2000 个会话与约 2 万美元成本,从零写出一个能编译 Linux 内核的 10 万行 C 编译器。本文完整复盘其中的关键工程设计:无限循环 harness、文件锁任务认领、为模型重写的测试体系、GCC 已知良好编译器对照法,以及 Agent 团队方案在 2026 年初的能力边界。 自有原创·FDE中国·2026-02-05
文章

解开 AI Agent 评测之谜:从 grader 选型到 pass^k 指标

Anthropic 工程团队的一手评测方法论:Agent 的自主性、多回合与状态修改能力让评测变得困难,本文给出对应解法。内容覆盖评测的基本构件(任务、试验、评分器、转录、结果、框架),代码/模型/人工三类评分器的选型权衡,能力评测与回归评测的分工,以及针对编码、对话、研究、计算机操作四类 Agent 的具体评测技术;重点解释 pass@k 与 pass^k 两个非确定性指标的差异,并给出从 20-50 个真实故障任务起步、八步走到可信评测的完整路线图。 自有原创·FDE中国·2026-01-09
文章

软件工程的下一个两年:五组对偶问题

Addy Osmani 对未来两年软件工程的五组对偶追问:初级开发者会消失还是回流、编程技能会萎缩还是增值、开发者角色会收缩为审计还是升格为编排者、专才与通才谁更安全、学历路径是否会被替代。每组问题都给出两种情景与面向初级和资深开发者的具体行动清单,是一份可直接自查的备战路线图。 自有原创·FDE中国·2026-01-05
文章

我的 2026 版 LLM 编程工作流:Spec 优先、小步迭代与人工把关

Addy Osmani 分享他进入 2026 年的 LLM 编程工作流:先写 spec 再编码、小步迭代、上下文打包、按任务选模型、高频提交、AI 互审与强自动化质量闸门。核心立场是「AI 增强的软件工程」——大胆用 AI 加速,但理解、测试与评审缺一不可,人类工程师始终是导演。 自有原创·FDE中国·2026-01-04
文章

用代码执行替代工具直连:MCP Agent 的效率重构

当 Agent 连接几十个 MCP 服务器、成百上千个工具时,预先加载的工具定义和回传的中间结果会吃掉海量 token。本文提出把 MCP 服务器呈现为代码 API,让 Agent 通过写代码来调用工具:按需渐进披露定义、在执行环境里过滤数据、用普通控制流替代工具调用链,并顺带获得隐私令牌化与状态持久化能力,token 消耗可降低约 98.7%。 自有原创·FDE中国·2025-11-04
文章

AI Agent 的上下文工程:压缩、笔记与子代理

Anthropic 官方长文:上下文工程(context engineering)如何取代提示工程成为构建 Agent 的核心课题。文章提出「注意力预算」与上下文腐坏两大概念,逐项拆解系统提示、工具与示例的策展原则,比较预取检索与即时检索,并给出压缩、结构化笔记与子代理架构三种应对长时程任务的完整方案。 自有原创·FDE中国·2025-09-29
文章

为 Agent 编写高效工具:用 Agent 改进工具设计

Anthropic 工程团队的工具设计方法论:Agent 是非确定性系统,工具是它与确定性系统之间的新契约。文章给出从原型、评测到用 Claude Code 自动改进工具的完整闭环,并提炼五条原则——选对工具而非堆工具、命名空间化、返回高信号上下文、控制 token 消耗、对工具描述做提示工程。 自有原创·FDE中国·2025-09-11
文章

长上下文是如何失败的:四种模式与修复方法

上下文窗口越大越好吗?Drew Breunig 在本文中给出否定答案,并系统梳理了长上下文的四种失败模式:上下文中毒(幻觉进入上下文被反复引用)、上下文分心(上下文压过训练所学)、上下文混淆(无关内容污染输出)、上下文冲突(上下文内部相互矛盾)。每种模式都配有 Gemini 2.5 玩宝可梦、Berkeley 函数调用榜单、微软与 Salesforce 分片提示等实证研究。失败对 Agent 打击最大,因为 Agent 恰恰运行在上下文膨胀的场景里。 自有原创·FDE中国·2025-06-22
文章

不要构建多智能体:Cognition 的两个上下文原则

Cognition 的 Walden Yan 在本文中给出构建长时程 Agent 的两条核心原则:共享上下文(并共享完整轨迹,而非单条消息),以及行动携带隐含决策。他用 Flappy Bird 克隆的子任务拆分案例演示多智能体架构为何天然脆弱,再以 Claude Code 子代理、编辑应用模型等生产级案例说明:在不违背原则的前提下,你依然有广阔的架构空间。对任何正在设计 Agent 架构的工程师,这是一篇值得反复对照的判断指南。 自有原创·FDE中国·2025-06-12
文章

快速改进 AI 产品的实地指南:错误分析、合成数据与领域专家方法

来自 30 多个生产环境项目的实战方法论:AI 团队最常见的错误是「工具优先」——埋头选框架、看通用指标仪表盘,却不做错误分析。本文给出正确的顺序:先逐条审读真实数据、归类失败模式,再动手改进;配套讲解自制数据查看器、让领域专家直接写提示词、用合成数据在零用户阶段冷启动评测、用二元判断加文字批评维护评测可信度,以及「路线图数实验而非功能」的能力漏斗方法。每个论点都配有 NurtureBoss、Rechat、Honeycomb、GitHub Copilot 等真实案例。 自有原创·FDE中国·2025-03-24