百度 AI Agent/大模型岗位 - 真实面经网络实录
整理自牛客、脉脉、CSDN等平台的真实面试分享,2024-2025年
面经一:大模型算法工程师(校招)
面试时间: 2024年10月(秋招)
岗位: 大模型算法工程师 - 文心大模型团队
结果: 已offer
一面(基础知识+代码,70分钟)
Q1:Transformer核心组件详细讲一下
回答思路:
- Self-Attention:计算序列内token间的关联 Attention(Q,K,V) = softmax(QK^T/√dk)V
- Multi-Head Attention:多头并行捕获不同子空间信息,最后concat
- FFN:两层全连接+激活函数(GELU/SwiGLU),提供非线性
- LayerNorm(现代用RMSNorm)+ 残差连接:稳定训练
- 面试官追问了为什么MHA需要除以√dk
Q2:Encoder-Only、Decoder-Only、Encoder-Decoder各适合什么任务?为什么现在主流是Decoder-Only?
回答思路:
- Encoder-Only(BERT):理解型任务(分类、NER、句子相似度)
- Decoder-Only(GPT系列):生成型任务,也通过统一的生成范式做理解任务
- Encoder-Decoder(T5、BART):序列到序列(翻译、摘要)
- Decoder-Only主流原因:统一范式简单、scaling效率好、zero-shot/few-shot能力强
Q3:RLHF完整流程讲一下。PPO和DPO的区别?
回答思路:
- RLHF三阶段:①SFT微调 ②Reward Model训练(人工标注偏好对) ③PPO优化(用RM信号+KL惩罚)
- PPO:需要RM+Critic,通过clip约束策略更新幅度,加KL散度防止偏离参考策略
- DPO:直接从偏好对学习,重参数化消除RM,更简单但效果可能略逊
- DPO loss:-E[log σ(β × (log π(yw|x)/πref(yw|x) - log π(yl|x)/πref(yl|x)))]
- 面试官追问了GRPO(DeepSeek的方案),讲了组内相对奖励的思想
Q4:大模型幻觉问题的原因和解决方法?
回答思路:
- 原因:训练数据噪声/偏差、模型过度自信、缺乏实时知识、解码策略导致的随机性
- 解决:RAG引入外部知识、CoT让推理过程透明、Self-Consistency多次采样投票、事实核查Agent后处理、微调高质量数据、降低temperature
Q5:代码题 - 买卖股票的最佳时机III(LeetCode 123,最多两次交易)
回答思路:状态机DP,定义5个状态(未操作/第一次持有/第一次卖出/第二次持有/第二次卖出)。O(n)时间O(1)空间。面试官追问了k次交易的通用解法。
二面(综合能力,60分钟)
Q1:让你设计一个Agent,你会怎么做?
回答思路:
- 定义目标和边界:明确Agent的任务范围和约束条件
- 选择LLM:根据任务复杂度选合适的模型(大模型做复杂推理,小模型做简单路由)
- 设计工具集:注册Agent可调用的API/工具,写清楚description
- 记忆方案:短期(对话历史滑动窗口)+ 长期(向量DB持久化)
- 编排策略:ReAct做简单任务、Plan-and-Execute做复杂任务、Multi-Agent做协作任务
- 评估体系:任务完成率、工具调用准确率、延迟、成本
- 兜底与安全:超时处理、错误恢复、内容安全过滤
Q2:如何让Agent支持多语言交互?
回答思路:
- 选用多语言LLM(GPT-4、Qwen、混元等都支持多语言)
- System Prompt和工具描述用英文(模型理解最好)
- 用户输入和输出保持用户语言
- 语言检测模块做路由
- 特定语言的RAG知识库(如中文法规用中文知识库)
- 翻译模块做兜底
Q3:手写一个简单的Tokenizer(BPE算法核心逻辑)
回答思路:
- 初始化:将文本拆分为字符级别的token
- 循环:统计相邻token对的频率→合并最高频的pair→更新词表
- 终止条件:达到目标词表大小
- 用Python实现了核心的merge逻辑(约30行代码)
- 面试官追问了BPE和WordPiece的区别
Q4:你对文心一言有什么了解?有什么优点和改进建议?
回答思路:
- 优点:中文理解能力强、支持多模态(图片/视频)、与百度搜索生态结合
- 改进:推理能力相比GPT-4有差距、有时会过于安全导致拒绝正常请求、创意生成能力可提升
- 建议客观评价,不要一味吹捧也不要贬低
Q5:当前大模型还存在什么问题?
回答思路:
- 幻觉:仍然无法完全消除
- 推理能力:复杂逻辑和数学推理仍有挑战
- 成本:大规模部署的计算成本高
- 实时性:训练数据有截止日期
- 安全:越狱攻击、偏见问题
- 评估:缺乏统一可靠的评估标准
三面(总监面,40分钟)
Q1:你能给团队带来什么贡献?
回答思路:技术层面(RAG系统经验+微调经验),协作层面(良好的沟通和文档能力),成长层面(自驱力强、持续学习)。
Q2:你怎么看大模型行业的未来?百度在其中的位置?
回答思路:大模型会逐步向Agent化、多模态、端侧部署发展。百度有搜索数据和AI积累的先发优势,文心大模型在中文场景有竞争力。
Q3:最近读了什么论文?
回答思路:讲了最近读的一篇关于Self-Play的论文,解释了核心idea和实验结论。
面试体验: 百度面试基础理论考察非常深入,特别是Transformer和RLHF相关的知识。手写Tokenizer是百度的特色题目,建议提前练习。面试官对文心一言产品的看法很在意,回答要客观专业。
面经二:AI Agent开发工程师(社招)
面试时间: 2025年1月
岗位: AI Agent开发 - 智能云千帆平台
结果: 已offer
一面(55分钟)
Q1:你了解百度智能云千帆平台吗?
回答思路:讲了千帆是百度的大模型开发平台,提供模型训练、推理、评测、Agent开发等一站式服务。对标阿里的百炼、腾讯的HAI。
Q2:如果从0到1设计一个企业级Agent平台,你怎么划分模块?
回答思路:
- Planner模块:任务分解、路径规划,支持ReAct/Plan-and-Execute等多种策略
- Memory模块:短期对话记忆(滑动窗口)+ 长期知识记忆(向量DB)+ 工作记忆(当前任务状态)
- Tool模块:工具注册中心、工具schema管理、权限控制
- Knowledge模块:知识库管理、RAG检索引擎、知识更新机制
- Runtime模块:Agent执行引擎、并发管理、资源调度
- Evaluation模块:评测数据集管理、自动评测流水线、AB测试
Q3:多轮对话中记忆冲突怎么处理?
回答思路:
- 时间优先:用最新的信息覆盖旧信息
- 来源可信度:不同来源(用户说的vs工具返回的vs推理得到的)有不同权重
- 版本管理:记忆带时间戳和来源标签,支持回溯
- 主动确认:当检测到矛盾信息时,向用户确认
- 实现:用ConflictDetector模块检测矛盾,用ConflictResolver模块解决
Q4:大模型的工具调用是怎么实现的?
回答思路:
- Prompt层面:在System Prompt中定义工具的JSON Schema(名称、参数、描述、示例)
- 模型层面:SFT训练数据中包含tool call样本,让模型学会生成结构化调用
- 引擎层面:解析模型输出的JSON→调用对应API→将结果回传
- 百度千帆平台的实现:内置了Function Calling框架,支持注册自定义工具
Q5:代码题 - 链表反转(LeetCode 206)+ 追问K个一组反转(LeetCode 25)
回答思路:先写了基础链表反转(迭代),然后扩展到K个一组,使用递归+迭代结合的方式。
二面(50分钟)
Q1:Agent的响应延迟怎么优化?
回答思路:
- 模型轻量化:简单任务用小模型,复杂任务才用大模型
- 异步处理:工具调用异步化,非阻塞
- 缓存机制:语义缓存(相似query命中缓存)、工具结果缓存
- 流式输出:生成过程实时返回
- 预计算:System Prompt的KV Cache预热
Q2:讲讲你做过的一个完整Agent项目
回答思路:讲了一个企业内部的IT运维Agent。能处理服务器告警、执行诊断命令、生成故障报告。详细讲了工具设计(SSH执行器、监控API、日志查询)、权限控制、安全隔离。
Q3:大模型的复读问题怎么解决?
回答思路:
- 采样层面:Repetition Penalty(对已出现token降低概率)、Frequency/Presence Penalty
- 训练层面:数据去重,避免重复模式在训练数据中出现
- 后处理:检测连续重复并截断
- 根本原因:attention倾向于近期token,形成正反馈循环
Q4:MoE模型如何扩大参数但不增推理成本?
回答思路:
- 多个Expert FFN + Router网络
- 每次只激活top-k个Expert(如Mixtral激活2/8)
- 总参数虽大但单次推理的FLOPs与一个Expert的Dense模型接近
- 挑战:负载均衡(auxiliary loss)、Expert坍缩、通信开销
- DeepSeek V3用了细粒度的MoE(256个小Expert选8个)
Q5:代码题 - 全排列(LeetCode 46)
回答思路:回溯法,used数组标记。
三面(VP面,35分钟)
Q1:你怎么看AI Agent在企业场景的商业价值?
回答思路:降低人力成本(客服、运维)、提升效率(知识管理、流程自动化)、创造新价值(智能分析、决策辅助)。用具体数据说明ROI。
Q2:你对百度AI战略的理解?
回答思路:从搜索到AI全栈布局(芯片/框架/模型/应用),千帆平台的生态化策略,文心大模型的行业赋能。
面试体验: 百度面Agent开发岗非常看重系统设计能力,要能讲清楚一个Agent平台的完整架构。千帆平台的了解是加分项。面试节奏紧凑,每轮都有编码环节。
面经三:大模型NLP算法(校招)
面试时间: 2025年3月
岗位: NLP算法工程师 - 搜索方向
结果: 二面中
一面(60分钟)
Q1:位置编码有哪些?RoPE的优点?
回答思路:
- 绝对位置编码:Sinusoidal(固定)、Learned(可学习)
- 相对位置编码:Relative Position Bias、RoPE、ALiBi
- RoPE优点:①编码相对位置 ②实现高效(逐元素旋转) ③理论上支持长度外推 ④与注意力机制天然兼容
Q2:大模型如何处理超长上下文?KIMI模型的方法你了解吗?
回答思路:
- 位置编码扩展:YaRN、NTK-aware scaling
- 稀疏注意力:Longformer的滑动窗口+全局attention
- 分块处理:Ring Attention、Sequence Parallelism
- KIMI的方法:据说使用了类似的长上下文技术,支持200k+上下文
- 实际应用:对超长文档用RAG可能比原生长上下文更经济
Q3:模型涌现能力你怎么理解?
回答思路:
- 定义:随模型规模增加,某些能力从无到有的突变
- 典型例子:few-shot learning、chain-of-thought reasoning
- 争议:BIG-bench research指出用非线性度量时涌现消失
- 可能的解释:模型内部表征的相变、任务难度的阈值效应
Q4:百度搜索和大模型怎么结合?
回答思路:
- Query理解增强:用LLM做query改写、意图识别
- 摘要生成:对搜索结果做LLM总结
- AI Search模式:直接用LLM回答问题,搜索结果做RAG来源
- 广告优化:LLM优化广告文案和匹配
Q5:代码题 - 树的层次遍历变体(之字形遍历 LeetCode 103)
回答思路:BFS + 奇偶层反转。
二面(55分钟)
Q1:训练大模型时数据怎么处理?清洗、配比、格式?
回答思路:
- 清洗:去重(MinHash/SimHash)、去噪(语言检测、质量打分)、去毒(有害内容过滤)
- 配比:不同来源(网页/书籍/代码/学术)按比例混合
- 格式:预训练用纯文本,SFT用instruction格式(alpaca/sharegpt)
- 数据质量评估:用小模型做质量打分、人工抽检
Q2:大模型的工具调用准确率不高怎么优化?
回答思路:
- 工具描述优化:清晰的功能说明+参数说明+示例
- SFT数据增强:构造更多工具调用训练样本
- 验证步骤:生成工具调用后先校验参数合法性
- 动态工具选择:根据query先过滤不相关的工具
- 失败重试:工具调用失败后让LLM分析原因并重试
Q3:Agent的Planning能力怎么评测?
回答思路:
- 任务完成率:是否最终完成了目标任务
- 步骤效率:实际步骤数 vs 最优路径步骤数
- 工具选择准确率:选择了正确的工具
- 规划合理性:人工评估规划方案的逻辑性
- Benchmark:WebArena、AgentBench等标准评测集
Q4:代码题 - 实现简单的注意力机制(用PyTorch)
回答思路:实现了scaled dot-product attention和multi-head attention,包括Q/K/V投影、缩放点积、softmax和输出投影。
面试体验: 百度NLP搜索方向面试会结合搜索业务场景出题,要思考大模型和搜索的结合方式。代码题除了LeetCode还有模型实现题(手写Attention/Tokenizer),这是百度面试的特色。
面经四:大模型应用开发(实习)
面试时间: 2024年7月
岗位: 大模型应用开发实习生
结果: 已offer
一面(45分钟)
Q1:RAG的核心原理?和直接用大模型回答有什么区别?
回答思路:
- RAG = 检索 + 生成,先从知识库检索相关文档,再让LLM基于检索结果生成答案
- 与直接回答的区别:减少幻觉(有据可查)、知识实时更新(不需重新训练)、可溯源
- 局限:检索质量影响最终效果、增加延迟、需要维护知识库
Q2:Python装饰器原理?写一个计时装饰器
回答思路:装饰器本质是接受函数作为参数返回新函数的高阶函数。写了@functools.wraps的计时装饰器。
Q3:生成器和迭代器的区别?
回答思路:
- 迭代器:实现__iter__和__next__方法的对象
- 生成器:用yield关键字的函数,是迭代器的简便实现
- 生成器惰性求值,节省内存
- 应用:处理大文件、数据流
Q4:你用过什么Agent框架?LangChain和LlamaIndex的区别?
回答思路:
- LangChain:通用的LLM应用框架,链式调用,Agent/Tool/Memory体系完善
- LlamaIndex:专注于数据索引和检索,RAG能力更强
- LangChain适合Agent开发,LlamaIndex适合知识库问答
- 近期趋势:LangGraph做工作流编排越来越流行
Q5:代码题 - 二分查找变体(旋转排序数组搜索 LeetCode 33)
回答思路:二分查找,先判断哪半边有序,再确定目标在哪半边。
二面(40分钟)
Q1:讲讲你的项目经验
回答思路:讲了一个基于LangChain的多轮对话RAG系统。
Q2:你对千帆平台的了解?用过吗?
回答思路:了解千帆提供模型推理API、模型微调、知识库管理等功能。实际调用过文心一言的API做过小项目。
Q3:你的职业规划?
回答思路:实习期间深入学习大模型应用开发,毕业后希望在AI Agent方向深耕。
面试体验: 百度实习面试相对正式岗位简单一些,但还是会考基础知识和编码能力。了解千帆平台并有实际使用经验会是加分项。实习面试2轮技术面即可,不需要三面。
面经五:AI Agent / 大模型应用开发(2026 新增公开来源)
来源:牛客、小红书公开页面;以下为摘要索引,完整内容请查看来源链接。
| 来源 | 标题 | 核心考点 |
|---|---|---|
| 小红书 | 百度 大模型应用开发 一面面经(小红书站内搜索原标题) | 多模态 RAG、表格切片、Memory 总结、Function Call、Redis 语义缓存、Session |
| 牛客 | 百度 AI Agent 开发 二面 | LangChain、LangGraph、Tool、Retriever、Memory、微调参数 |
| 牛客 | 百度 Agent 面经 | LangGraph、checkpoint、memory、sandbox、monitoring、skill 化、RAG |
| 牛客 | 大模型、Agent面经总结【04/28】腾讯 / 百度 总结 | 百度 AI 大模型产品、生态集成、Agent/工具调用、向量检索 |
2026 高频追问
-
长表格跨 chunk 如何保留表头和语义?扫描 PDF 与结构化表格如何处理?
-
多模态 RAG 中视觉 embedding 什么时候有价值?
-
Memory 总结何时触发?如何避免摘要丢失关键信息?
-
Redis 语义缓存如何判断相似问法命中?如何避免错误缓存污染?
-
LangGraph checkpoint 恢复如何保证幂等?监控与沙箱如何闭环?
总结与建议
百度面试特点
-
理论深度极深:Transformer、RLHF、位置编码等会追问到数学公式级别
-
手写代码是特色:除了LeetCode还会要求手写Tokenizer/Attention等模型代码
-
必问文心一言:一定要提前用文心一言/千帆平台,能给出客观评价
-
Agent设计题:从0到1设计Agent系统是高频题
-
算法题偏重DP和数据结构:股票系列、树、链表是常见类型
准备建议
-
能手写BPE Tokenizer和Multi-Head Attention的PyTorch代码
-
RLHF/DPO/PPO的完整流程和数学公式要烂熟于心
-
提前体验文心一言和千帆平台,准备客观的产品评价
-
准备一个Agent项目,能讲清楚从设计到部署的完整链路
-
算法题重点刷DP类(股票系列)和手写模型代码
-
关注百度在AI搜索和Agent领域的最新动态