Agent 项目深挖与压力面试:连续追问链

目标:把“我做过一个 Agent”训练成可以经受 10–20 分钟连续追问的工程叙述。

一、评分标准

每条追问链按 0–3 分评估:

分数 表现
0 只报框架名,无法解释输入输出
1 能描述正常流程,但没有约束和数据
2 能解释选型、失败路径、指标和取舍
3 有基线、消融、线上证据、残余风险和下一步

二、追问链 1:为什么需要 Agent

  1. 这个业务为什么不能用普通 API 或规则工作流?

  2. 哪一步必须依赖模型决策?

  3. 如果把 Agent 改成固定 DAG,效果会下降多少?

  4. 你做过单 Agent 基线吗?

  5. 为什么需要多 Agent?

  6. 多 Agent 增加了多少延迟和 Token?

  7. 什么条件下你会退回 Workflow?

优秀答案证据:基线对比、任务复杂度分层、消融实验、成本数据。

三、追问链 2:RAG 为什么有效

  1. 原始文档是什么格式?规模多大?

  2. PDF 表格、扫描件和跨页段落怎么处理?

  3. 为什么选择当前 Chunk 策略?

  4. Dense、BM25、RRF、Rerank 分别贡献多少?

  5. 召回失败和生成失败如何区分?

  6. 知识更新时是否需要重建全部索引?

  7. 线上出现错误答案时如何回溯到证据?

优秀答案证据:检索评测集、Recall@K/NDCG、RAGAS、失败样本、索引版本。

四、追问链 3:工具调用是否可靠

  1. 工具 Schema 谁定义、谁校验?

  2. 模型传入不存在的枚举值怎么办?

  3. 调用超时后能直接重试吗?

  4. 如果请求已经执行但响应丢失怎么办?

  5. 删除、付款、发信等高风险工具如何审批?

  6. 工具升级后旧任务如何恢复?

  7. 如何防止 Prompt Injection 诱导越权?

优秀答案证据:JSON Schema、权限 Scope、幂等键、执行日志、补偿动作、审计记录。

五、追问链 4:Memory 与 Context

  1. 哪些内容只属于当前 Turn?

  2. 哪些属于 Session Working State?

  3. 什么可以进入长期 Memory?

  4. 谁决定写入、更新和删除?

  5. 如何防止错误信息永久污染?

  6. 上下文压缩后怎么评估信息损失?

  7. 用户要求删除记忆时能否彻底删除?

优秀答案证据:Memory Schema、Scope、TTL、置信度、来源、版本、删除链路。

六、追问链 5:长任务与恢复

  1. Agent 执行到一半进程退出怎么办?

  2. Checkpoint 保存什么?

  3. 为什么不能只保存聊天记录?

  4. 两个 Worker 同时恢复同一任务怎么办?

  5. 已经执行的工具会不会重复执行?

  6. 人工审批等待一天后如何恢复?

  7. 模型或工具版本变化后是否允许继续?

优秀答案证据:Task/Run/Event/Checkpoint/Artifact 模型、Lease、幂等键、版本固定。

七、追问链 6:Agent 为什么失败

  1. 最近一个 bad case 是什么?

  2. 如何判断是规划、上下文、检索、工具还是模型问题?

  3. Trace 里哪个 Span 首先出现异常?

  4. 是否出现过重复动作或路径震荡?

  5. 修复后如何防止回归?

  6. 只优化了平均值,还是长尾也改善?

  7. 失败时用户能否得到可操作的恢复说明?

优秀答案证据:错误分类、Trace、前后指标、回归用例、残余风险。

八、追问链 7:评测是不是“自嗨”

  1. 成功标准是谁定义的?

  2. 模型说完成了就算成功吗?

  3. LLM-as-Judge 与人工评分一致性如何?

  4. 有没有规则、测试或环境状态作为独立验证?

  5. 评测集是否混入训练数据?

  6. 是否包含超时、权限、注入和恢复场景?

  7. 上线门禁是什么?指标下降是否自动阻止发布?

优秀答案证据:Outcome/Trajectory/State Grading、盲测、版本对比和发布门禁。

九、追问链 8:性能与成本

  1. P50/P95 延迟是多少?

  2. 时间花在模型、检索还是工具?

  3. 哪些步骤可以并行?

  4. 哪些请求可以走小模型或缓存?

  5. 上下文成本怎么限制?

  6. 高峰期如何排队、限流和降级?

  7. 质量与成本的 Pareto 前沿是什么?

优秀答案证据:Trace 分解、压测、模型路由、缓存命中率、质量回归。

十、追问链 9:Coding Agent

  1. Agent 如何理解陌生仓库?

  2. 搜索、LSP、文件读取怎样协同?

  3. 如何避免一次加载太多文件?

  4. AI 生成代码如何验证?

  5. 多个 Agent 并行修改时怎么隔离?

  6. Merge 成功是否代表任务成功?

  7. 什么证据可以提交给 Reviewer?

优秀答案证据:Context Map、Worktree、Diff、测试、浏览器验证、Completion Report。

十一、练习方式

每次选择一个自己的项目:

  1. 先做 2 分钟无打断介绍;

  2. 随机选择两条追问链;

  3. 每题最多回答 90 秒;

  4. 所有“提升很多”“效果不错”必须换成指标或实验;

  5. 回答结束后记录暴露出的证据缺口;

  6. 回到项目中补测试、日志、文档或评测,而不是只改话术。