Agent 项目深挖与压力面试:连续追问链
目标:把“我做过一个 Agent”训练成可以经受 10–20 分钟连续追问的工程叙述。
一、评分标准
每条追问链按 0–3 分评估:
| 分数 | 表现 |
|---|---|
| 0 | 只报框架名,无法解释输入输出 |
| 1 | 能描述正常流程,但没有约束和数据 |
| 2 | 能解释选型、失败路径、指标和取舍 |
| 3 | 有基线、消融、线上证据、残余风险和下一步 |
二、追问链 1:为什么需要 Agent
-
这个业务为什么不能用普通 API 或规则工作流?
-
哪一步必须依赖模型决策?
-
如果把 Agent 改成固定 DAG,效果会下降多少?
-
你做过单 Agent 基线吗?
-
为什么需要多 Agent?
-
多 Agent 增加了多少延迟和 Token?
-
什么条件下你会退回 Workflow?
优秀答案证据:基线对比、任务复杂度分层、消融实验、成本数据。
三、追问链 2:RAG 为什么有效
-
原始文档是什么格式?规模多大?
-
PDF 表格、扫描件和跨页段落怎么处理?
-
为什么选择当前 Chunk 策略?
-
Dense、BM25、RRF、Rerank 分别贡献多少?
-
召回失败和生成失败如何区分?
-
知识更新时是否需要重建全部索引?
-
线上出现错误答案时如何回溯到证据?
优秀答案证据:检索评测集、Recall@K/NDCG、RAGAS、失败样本、索引版本。
四、追问链 3:工具调用是否可靠
-
工具 Schema 谁定义、谁校验?
-
模型传入不存在的枚举值怎么办?
-
调用超时后能直接重试吗?
-
如果请求已经执行但响应丢失怎么办?
-
删除、付款、发信等高风险工具如何审批?
-
工具升级后旧任务如何恢复?
-
如何防止 Prompt Injection 诱导越权?
优秀答案证据:JSON Schema、权限 Scope、幂等键、执行日志、补偿动作、审计记录。
五、追问链 4:Memory 与 Context
-
哪些内容只属于当前 Turn?
-
哪些属于 Session Working State?
-
什么可以进入长期 Memory?
-
谁决定写入、更新和删除?
-
如何防止错误信息永久污染?
-
上下文压缩后怎么评估信息损失?
-
用户要求删除记忆时能否彻底删除?
优秀答案证据:Memory Schema、Scope、TTL、置信度、来源、版本、删除链路。
六、追问链 5:长任务与恢复
-
Agent 执行到一半进程退出怎么办?
-
Checkpoint 保存什么?
-
为什么不能只保存聊天记录?
-
两个 Worker 同时恢复同一任务怎么办?
-
已经执行的工具会不会重复执行?
-
人工审批等待一天后如何恢复?
-
模型或工具版本变化后是否允许继续?
优秀答案证据:Task/Run/Event/Checkpoint/Artifact 模型、Lease、幂等键、版本固定。
七、追问链 6:Agent 为什么失败
-
最近一个 bad case 是什么?
-
如何判断是规划、上下文、检索、工具还是模型问题?
-
Trace 里哪个 Span 首先出现异常?
-
是否出现过重复动作或路径震荡?
-
修复后如何防止回归?
-
只优化了平均值,还是长尾也改善?
-
失败时用户能否得到可操作的恢复说明?
优秀答案证据:错误分类、Trace、前后指标、回归用例、残余风险。
八、追问链 7:评测是不是“自嗨”
-
成功标准是谁定义的?
-
模型说完成了就算成功吗?
-
LLM-as-Judge 与人工评分一致性如何?
-
有没有规则、测试或环境状态作为独立验证?
-
评测集是否混入训练数据?
-
是否包含超时、权限、注入和恢复场景?
-
上线门禁是什么?指标下降是否自动阻止发布?
优秀答案证据:Outcome/Trajectory/State Grading、盲测、版本对比和发布门禁。
九、追问链 8:性能与成本
-
P50/P95 延迟是多少?
-
时间花在模型、检索还是工具?
-
哪些步骤可以并行?
-
哪些请求可以走小模型或缓存?
-
上下文成本怎么限制?
-
高峰期如何排队、限流和降级?
-
质量与成本的 Pareto 前沿是什么?
优秀答案证据:Trace 分解、压测、模型路由、缓存命中率、质量回归。
十、追问链 9:Coding Agent
-
Agent 如何理解陌生仓库?
-
搜索、LSP、文件读取怎样协同?
-
如何避免一次加载太多文件?
-
AI 生成代码如何验证?
-
多个 Agent 并行修改时怎么隔离?
-
Merge 成功是否代表任务成功?
-
什么证据可以提交给 Reviewer?
优秀答案证据:Context Map、Worktree、Diff、测试、浏览器验证、Completion Report。
十一、练习方式
每次选择一个自己的项目:
-
先做 2 分钟无打断介绍;
-
随机选择两条追问链;
-
每题最多回答 90 秒;
-
所有“提升很多”“效果不错”必须换成指标或实验;
-
回答结束后记录暴露出的证据缺口;
-
回到项目中补测试、日志、文档或评测,而不是只改话术。