美团 AI Agent 工程师 - 面试题 & 面经


Q: 如何设计一个本地生活领域的智能客服 Agent?需要对接哪些业务系统?

💡 思考逻辑: 美团客服是 Agent 的典型落地场景,面试官考察你对业务流程的理解和系统集成能力。

参考答案: 本地生活客服 Agent 架构:1)意图识别层——分类用户诉求(查询订单、申请退款、商家投诉、配送问题、优惠咨询),用意图分类模型 + 规则引擎双路;2)工具集成——订单系统(查询/修改订单状态)、退款系统(发起退款流程)、配送系统(查骑手位置/预计到达时间)、优惠券系统(查询/发放优惠)、商家系统(获取商家信息/营业状态);3)对话策略——信息收集(缺少订单号时主动询问)→ 问题诊断(调用工具查询状态)→ 方案生成(退款/补偿/解释)→ 执行确认;4)升级机制——当 Agent 置信度低或用户情绪激动时自动转人工,传递完整上下文;5)个性化——基于用户历史订单和会员等级调整服务策略(高频用户优先处理)。

Q: 配送调度场景中 Agent 和传统运筹优化算法如何结合?各自的边界在哪?

💡 思考逻辑: 美团有极强的运筹优化能力,面试官考察你是否能正确理解 Agent 和传统算法的边界,不迷信 LLM。

参考答案: 职责分工:1)传统运筹优化——做核心调度决策(TSP/VRP 路径规划、订单分配、运力调度),优势是精确、可控、可验证,毫秒级出结果;2)LLM Agent——做异常处理和决策辅助:恶劣天气时调整配送策略(通知用户延迟、调整运力分配)、处理用户的自然语言请求('让骑手放在门口')、分析配送异常原因('为什么这个区域总超时'→分析地理/天气/商家出餐等因素);3)结合方式——Agent 作为运筹系统的'翻译层'和'决策辅助层',不替代核心调度算法。关键原则:确定性强、对实时性要求高的决策交给运筹优化;模糊性高、需要常识推理的场景交给 Agent。美团的智能调度已经很成熟,LLM 的价值在于处理长尾异常场景。

Q: 如何设计 Agent 驱动的个性化推荐对话?和传统推荐系统有什么融合方式?

💡 思考逻辑: 美团的推荐系统是核心竞争力,面试官考察你对 Agent + 推荐融合的创新思考。

参考答案: Agent 推荐 vs 传统推荐:传统推荐是'猜你喜欢'的被动推荐,Agent 推荐是'帮你选'的主动对话。融合设计:1)Agent 做需求澄清——通过对话收集用户细粒度偏好('想吃辣的还是清淡的?预算多少?几个人吃?'),转化为结构化 query;2)传统推荐做候选生成——将结构化 query 传给推荐引擎(协同过滤 + 深度模型),返回候选集;3)Agent 做结果解释——用自然语言解释推荐理由('推荐这家是因为你上周点过类似的,评分 4.8,距离 1.2km');4)交互式优化——用户反馈('不要太远')→ Agent 更新约束 → 推荐引擎重新排序。核心价值是把推荐从'信息流被动曝光'变成'对话式主动发现',转化率实验中通常提升 15-25%。

Q: Agent 上线后效果不好怎么办?如何诊断和优化?

💡 思考逻辑: 这是最真实的面试题之一,面试官考察你的工程诊断能力,不是只会搭 demo。

参考答案: Agent 效果诊断框架(DICE):1)Data 数据问题——检查 prompt 是否有歧义、工具描述是否准确、few-shot 示例是否充分;查看 bad case 分布,是全面差还是特定类别差;2)Inference 推理问题——分析 Agent 的 thought chain,看哪一步推理出错(意图理解错?工具选择错?参数填充错?结果综合错?);3)Context 上下文问题——是否超 context window?是否关键信息被淹没?是否记忆管理有缺陷导致信息丢失?4)Execution 执行问题——工具是否正常返回?延迟是否可接受?是否有 race condition?优化步骤:先做 error analysis(分析 100 个 bad case 的失败原因分布)→ 针对最大失败类别优先修复 → A/B 测试验证 → 迭代。切忌一上来就换模型。

Q: 如何在保证用户体验的前提下控制 Agent 的 Token 消耗成本?

💡 思考逻辑: 美团日均千万级订单,Agent 成本控制是生死线,面试官考察你的成本意识。

参考答案: Token 成本优化策略:1)请求路由——意图分类器前置,简单问题(查订单状态)走规则引擎不消耗 LLM token,只有复杂问题走 Agent,可减少 60% 请求量;2)Prompt 精简——system prompt 用结构化格式(JSON/XML),比自然语言节省 30-50% token;去除冗余的 few-shot 示例;3)语义缓存——用 GPTCache 做语义相似度匹配,相似问题直接返回缓存结果;4)模型梯度——简单子任务用小模型(如 Qwen-7B),只有核心推理用大模型(GPT-4 级别);5)上下文压缩——长对话做 summarization 后再传给模型,而不是全量传历史;6)Streaming 优化——检测到 Agent 已有足够信息时提前终止生成。美团的量级下,每减少 1% 的 token 消耗就是巨大的成本节约。