Agent 项目简历与 STAR 表达

一、简历不是技术名词清单

面试官通常想快速判断:

  1. 这是教程项目还是真实问题;

  2. 你负责了哪部分;

  3. 为什么需要 Agent;

  4. 系统失败时你做过什么;

  5. 有没有可验证结果。

推荐公式:

1
动作 + 业务对象 + 技术约束 + 核心方案 + 可验证结果

弱表达:

使用 LangGraph、RAG、MCP 搭建智能问答系统。

强表达:

负责内部知识助手的检索与执行链路,将查询改写、混合召回、重排和工具审批建模为可恢复状态图;在固定回归集上将 Verified Success 从 A 提升到 B,并将 P95 延迟控制在 C 秒内。

没有真实数字时不要编造,可以写:

建立 80 条回归集并记录 Recall@5、人工正确率、P95 延迟和单任务 Token,形成上线前门禁。

二、简历项目四行模板

第 1 行:问题与规模

  • 面向什么用户;

  • 解决什么高频任务;

  • 文档量、请求量、工具量或任务时长;

  • 主要约束是什么。

第 2 行:架构和个人职责

  • 自己负责的边界;

  • Agent / Workflow / Runtime 如何划分;

  • 为什么这样选型。

第 3 行:最难问题

  • RAG bad case;

  • 上下文超长;

  • 工具超时和副作用;

  • 多 Agent 冲突;

  • 安全与权限。

第 4 行:结果与证据

  • Verified Success;

  • Recall@K / NDCG;

  • P95 延迟;

  • Token 成本;

  • 人工接管率;

  • 故障恢复率。

三、1 分钟项目介绍

1
2
3
4
5
0–10 秒:业务问题和用户
10–20 秒:我的职责
20–40 秒:核心架构和关键取舍
40–50 秒:最大难点及解决方式
50–60 秒:评测结果和业务价值

示例骨架:

这个项目为【用户】解决【任务】。我主要负责【边界】。系统没有直接使用开放式 Agent,而是将【确定性步骤】放入 Workflow,只让模型负责【语义决策】。最大问题是【失败案例】,我通过【方案】解决,并用【评测集/指标】验证。最终得到【结果】,仍存在【残余风险】。

四、3 分钟项目介绍

  1. 背景:用户为什么需要它;

  2. 约束:数据、时延、权限、成本;

  3. 架构:输入、状态、模型、工具、输出;

  4. 选型:为什么是 Agent,而不是 Workflow;

  5. 难点:选择一个真实失败案例;

  6. 改进:定位、实验、上线;

  7. 指标:基线与最终结果;

  8. 反思:如果重做会简化或加强什么。

五、技术难点故事

故事模板:工具超时和重复副作用

  • S:高风险工具偶发超时,无法判断服务端是否执行;

  • T:必须允许恢复,同时禁止重复提交;

  • A:引入 tool_call_id、结果日志、状态查询和补偿操作;

  • R:在故障注入测试中验证重复消费不会重复产生副作用;

  • 追问准备:为什么不用简单重试?哪些操作不能补偿?

故事模板:RAG 效果不稳定

  • S:复杂 PDF 和表格问题召回率低;

  • T:区分解析、召回、重排和生成问题;

  • A:建立分层评测,加入表格结构、混合检索和 Rerank;

  • R:分别报告 Recall@K、Faithfulness 和端到端成功率;

  • 追问准备:数据集怎么标注?如何避免测试集污染?

故事模板:Agent 死循环

  • S:Agent 在两个工具之间重复切换;

  • T:既要终止浪费,又不能误杀正常探索;

  • A:动作指纹、错误指纹、无进展检测和失败预算;

  • R:报告震荡率、平均轮次和人工接管率变化;

  • 追问准备:阈值怎么确定?强制重规划失败怎么办?

六、失败案例故事

失败案例不要说成“最后解决了,所以不算失败”。应包含:

1
2
3
4
5
6
7
错误判断
→ 造成的影响
→ 如何发现
→ 根因
→ 修复
→ 回归测试
→ 仍然存在的风险

推荐准备三类:

  1. 技术选型失败;

  2. 线上或压测失败;

  3. 协作和需求理解失败。

七、指标表达

避免:

  • 效果很好;

  • 准确率明显提升;

  • 延迟大幅下降;

  • 用户反馈不错。

推荐:

维度 可用指标
结果 Task Success、Verified Success、人工通过率
检索 Recall@K、MRR、NDCG
过程 无效工具调用率、平均重试数、路径震荡率
性能 P50/P95 延迟、吞吐量、队列等待
成本 单任务 Token、模型费用、缓存命中率
安全 越权拦截率、高风险审批覆盖率

数字必须说明:样本量、统计窗口、基线和测量方法。

八、不同背景的表达重点

  • Java/Go 后端:突出并发、队列、状态机、幂等、可观测性和平台化;

  • Python/算法:突出数据、评测、模型路由、训练和推理;

  • 前端/全栈:突出流式交互、状态可视化、人工审批和端到端交付;

  • 应届生:突出可复现实验、源码阅读、测试和清晰的个人贡献。

九、面试前检查

  • 能否在 1 分钟和 3 分钟内讲清项目;

  • 能否说明为什么不用更简单方案;

  • 是否有一个真实 bad case;

  • 是否有独立验证,而不是模型自评;

  • 是否能给出成本、延迟和安全数据;

  • 是否清楚哪些结论尚未验证;

  • 是否准备了对团队 Agent 业务、评测和上线权限的反问。