Agent 项目简历与 STAR 表达
一、简历不是技术名词清单
面试官通常想快速判断:
-
这是教程项目还是真实问题;
-
你负责了哪部分;
-
为什么需要 Agent;
-
系统失败时你做过什么;
-
有没有可验证结果。
推荐公式:
1 | 动作 + 业务对象 + 技术约束 + 核心方案 + 可验证结果 |
弱表达:
使用 LangGraph、RAG、MCP 搭建智能问答系统。
强表达:
负责内部知识助手的检索与执行链路,将查询改写、混合召回、重排和工具审批建模为可恢复状态图;在固定回归集上将 Verified Success 从 A 提升到 B,并将 P95 延迟控制在 C 秒内。
没有真实数字时不要编造,可以写:
建立 80 条回归集并记录 Recall@5、人工正确率、P95 延迟和单任务 Token,形成上线前门禁。
二、简历项目四行模板
第 1 行:问题与规模
-
面向什么用户;
-
解决什么高频任务;
-
文档量、请求量、工具量或任务时长;
-
主要约束是什么。
第 2 行:架构和个人职责
-
自己负责的边界;
-
Agent / Workflow / Runtime 如何划分;
-
为什么这样选型。
第 3 行:最难问题
-
RAG bad case;
-
上下文超长;
-
工具超时和副作用;
-
多 Agent 冲突;
-
安全与权限。
第 4 行:结果与证据
-
Verified Success;
-
Recall@K / NDCG;
-
P95 延迟;
-
Token 成本;
-
人工接管率;
-
故障恢复率。
三、1 分钟项目介绍
1 | 0–10 秒:业务问题和用户 |
示例骨架:
这个项目为【用户】解决【任务】。我主要负责【边界】。系统没有直接使用开放式 Agent,而是将【确定性步骤】放入 Workflow,只让模型负责【语义决策】。最大问题是【失败案例】,我通过【方案】解决,并用【评测集/指标】验证。最终得到【结果】,仍存在【残余风险】。
四、3 分钟项目介绍
-
背景:用户为什么需要它;
-
约束:数据、时延、权限、成本;
-
架构:输入、状态、模型、工具、输出;
-
选型:为什么是 Agent,而不是 Workflow;
-
难点:选择一个真实失败案例;
-
改进:定位、实验、上线;
-
指标:基线与最终结果;
-
反思:如果重做会简化或加强什么。
五、技术难点故事
故事模板:工具超时和重复副作用
-
S:高风险工具偶发超时,无法判断服务端是否执行;
-
T:必须允许恢复,同时禁止重复提交;
-
A:引入
tool_call_id、结果日志、状态查询和补偿操作; -
R:在故障注入测试中验证重复消费不会重复产生副作用;
-
追问准备:为什么不用简单重试?哪些操作不能补偿?
故事模板:RAG 效果不稳定
-
S:复杂 PDF 和表格问题召回率低;
-
T:区分解析、召回、重排和生成问题;
-
A:建立分层评测,加入表格结构、混合检索和 Rerank;
-
R:分别报告 Recall@K、Faithfulness 和端到端成功率;
-
追问准备:数据集怎么标注?如何避免测试集污染?
故事模板:Agent 死循环
-
S:Agent 在两个工具之间重复切换;
-
T:既要终止浪费,又不能误杀正常探索;
-
A:动作指纹、错误指纹、无进展检测和失败预算;
-
R:报告震荡率、平均轮次和人工接管率变化;
-
追问准备:阈值怎么确定?强制重规划失败怎么办?
六、失败案例故事
失败案例不要说成“最后解决了,所以不算失败”。应包含:
1 | 错误判断 |
推荐准备三类:
-
技术选型失败;
-
线上或压测失败;
-
协作和需求理解失败。
七、指标表达
避免:
-
效果很好;
-
准确率明显提升;
-
延迟大幅下降;
-
用户反馈不错。
推荐:
| 维度 | 可用指标 |
|---|---|
| 结果 | Task Success、Verified Success、人工通过率 |
| 检索 | Recall@K、MRR、NDCG |
| 过程 | 无效工具调用率、平均重试数、路径震荡率 |
| 性能 | P50/P95 延迟、吞吐量、队列等待 |
| 成本 | 单任务 Token、模型费用、缓存命中率 |
| 安全 | 越权拦截率、高风险审批覆盖率 |
数字必须说明:样本量、统计窗口、基线和测量方法。
八、不同背景的表达重点
-
Java/Go 后端:突出并发、队列、状态机、幂等、可观测性和平台化;
-
Python/算法:突出数据、评测、模型路由、训练和推理;
-
前端/全栈:突出流式交互、状态可视化、人工审批和端到端交付;
-
应届生:突出可复现实验、源码阅读、测试和清晰的个人贡献。
九、面试前检查
-
能否在 1 分钟和 3 分钟内讲清项目;
-
能否说明为什么不用更简单方案;
-
是否有一个真实 bad case;
-
是否有独立验证,而不是模型自评;
-
是否能给出成本、延迟和安全数据;
-
是否清楚哪些结论尚未验证;
-
是否准备了对团队 Agent 业务、评测和上线权限的反问。