百度 AI Agent/大模型岗位 - 真实面经网络实录

整理自牛客、脉脉、CSDN等平台的真实面试分享,2024-2025年


面经一:大模型算法工程师(校招)

面试时间: 2024年10月(秋招)
岗位: 大模型算法工程师 - 文心大模型团队
结果: 已offer

一面(基础知识+代码,70分钟)

Q1:Transformer核心组件详细讲一下

回答思路:

  • Self-Attention:计算序列内token间的关联 Attention(Q,K,V) = softmax(QK^T/√dk)V
  • Multi-Head Attention:多头并行捕获不同子空间信息,最后concat
  • FFN:两层全连接+激活函数(GELU/SwiGLU),提供非线性
  • LayerNorm(现代用RMSNorm)+ 残差连接:稳定训练
  • 面试官追问了为什么MHA需要除以√dk

Q2:Encoder-Only、Decoder-Only、Encoder-Decoder各适合什么任务?为什么现在主流是Decoder-Only?

回答思路:

  • Encoder-Only(BERT):理解型任务(分类、NER、句子相似度)
  • Decoder-Only(GPT系列):生成型任务,也通过统一的生成范式做理解任务
  • Encoder-Decoder(T5、BART):序列到序列(翻译、摘要)
  • Decoder-Only主流原因:统一范式简单、scaling效率好、zero-shot/few-shot能力强

Q3:RLHF完整流程讲一下。PPO和DPO的区别?

回答思路:

  • RLHF三阶段:①SFT微调 ②Reward Model训练(人工标注偏好对) ③PPO优化(用RM信号+KL惩罚)
  • PPO:需要RM+Critic,通过clip约束策略更新幅度,加KL散度防止偏离参考策略
  • DPO:直接从偏好对学习,重参数化消除RM,更简单但效果可能略逊
  • DPO loss:-E[log σ(β × (log π(yw|x)/πref(yw|x) - log π(yl|x)/πref(yl|x)))]
  • 面试官追问了GRPO(DeepSeek的方案),讲了组内相对奖励的思想

Q4:大模型幻觉问题的原因和解决方法?

回答思路:

  • 原因:训练数据噪声/偏差、模型过度自信、缺乏实时知识、解码策略导致的随机性
  • 解决:RAG引入外部知识、CoT让推理过程透明、Self-Consistency多次采样投票、事实核查Agent后处理、微调高质量数据、降低temperature

Q5:代码题 - 买卖股票的最佳时机III(LeetCode 123,最多两次交易)

回答思路:状态机DP,定义5个状态(未操作/第一次持有/第一次卖出/第二次持有/第二次卖出)。O(n)时间O(1)空间。面试官追问了k次交易的通用解法。

二面(综合能力,60分钟)

Q1:让你设计一个Agent,你会怎么做?

回答思路:

  1. 定义目标和边界:明确Agent的任务范围和约束条件
  2. 选择LLM:根据任务复杂度选合适的模型(大模型做复杂推理,小模型做简单路由)
  3. 设计工具集:注册Agent可调用的API/工具,写清楚description
  4. 记忆方案:短期(对话历史滑动窗口)+ 长期(向量DB持久化)
  5. 编排策略:ReAct做简单任务、Plan-and-Execute做复杂任务、Multi-Agent做协作任务
  6. 评估体系:任务完成率、工具调用准确率、延迟、成本
  7. 兜底与安全:超时处理、错误恢复、内容安全过滤

Q2:如何让Agent支持多语言交互?

回答思路:

  • 选用多语言LLM(GPT-4、Qwen、混元等都支持多语言)
  • System Prompt和工具描述用英文(模型理解最好)
  • 用户输入和输出保持用户语言
  • 语言检测模块做路由
  • 特定语言的RAG知识库(如中文法规用中文知识库)
  • 翻译模块做兜底

Q3:手写一个简单的Tokenizer(BPE算法核心逻辑)

回答思路:

  • 初始化:将文本拆分为字符级别的token
  • 循环:统计相邻token对的频率→合并最高频的pair→更新词表
  • 终止条件:达到目标词表大小
  • 用Python实现了核心的merge逻辑(约30行代码)
  • 面试官追问了BPE和WordPiece的区别

Q4:你对文心一言有什么了解?有什么优点和改进建议?

回答思路:

  • 优点:中文理解能力强、支持多模态(图片/视频)、与百度搜索生态结合
  • 改进:推理能力相比GPT-4有差距、有时会过于安全导致拒绝正常请求、创意生成能力可提升
  • 建议客观评价,不要一味吹捧也不要贬低

Q5:当前大模型还存在什么问题?

回答思路:

  • 幻觉:仍然无法完全消除
  • 推理能力:复杂逻辑和数学推理仍有挑战
  • 成本:大规模部署的计算成本高
  • 实时性:训练数据有截止日期
  • 安全:越狱攻击、偏见问题
  • 评估:缺乏统一可靠的评估标准

三面(总监面,40分钟)

Q1:你能给团队带来什么贡献?

回答思路:技术层面(RAG系统经验+微调经验),协作层面(良好的沟通和文档能力),成长层面(自驱力强、持续学习)。

Q2:你怎么看大模型行业的未来?百度在其中的位置?

回答思路:大模型会逐步向Agent化、多模态、端侧部署发展。百度有搜索数据和AI积累的先发优势,文心大模型在中文场景有竞争力。

Q3:最近读了什么论文?

回答思路:讲了最近读的一篇关于Self-Play的论文,解释了核心idea和实验结论。

面试体验: 百度面试基础理论考察非常深入,特别是Transformer和RLHF相关的知识。手写Tokenizer是百度的特色题目,建议提前练习。面试官对文心一言产品的看法很在意,回答要客观专业。


面经二:AI Agent开发工程师(社招)

面试时间: 2025年1月
岗位: AI Agent开发 - 智能云千帆平台
结果: 已offer

一面(55分钟)

Q1:你了解百度智能云千帆平台吗?

回答思路:讲了千帆是百度的大模型开发平台,提供模型训练、推理、评测、Agent开发等一站式服务。对标阿里的百炼、腾讯的HAI。

Q2:如果从0到1设计一个企业级Agent平台,你怎么划分模块?

回答思路:

  • Planner模块:任务分解、路径规划,支持ReAct/Plan-and-Execute等多种策略
  • Memory模块:短期对话记忆(滑动窗口)+ 长期知识记忆(向量DB)+ 工作记忆(当前任务状态)
  • Tool模块:工具注册中心、工具schema管理、权限控制
  • Knowledge模块:知识库管理、RAG检索引擎、知识更新机制
  • Runtime模块:Agent执行引擎、并发管理、资源调度
  • Evaluation模块:评测数据集管理、自动评测流水线、AB测试

Q3:多轮对话中记忆冲突怎么处理?

回答思路:

  • 时间优先:用最新的信息覆盖旧信息
  • 来源可信度:不同来源(用户说的vs工具返回的vs推理得到的)有不同权重
  • 版本管理:记忆带时间戳和来源标签,支持回溯
  • 主动确认:当检测到矛盾信息时,向用户确认
  • 实现:用ConflictDetector模块检测矛盾,用ConflictResolver模块解决

Q4:大模型的工具调用是怎么实现的?

回答思路:

  • Prompt层面:在System Prompt中定义工具的JSON Schema(名称、参数、描述、示例)
  • 模型层面:SFT训练数据中包含tool call样本,让模型学会生成结构化调用
  • 引擎层面:解析模型输出的JSON→调用对应API→将结果回传
  • 百度千帆平台的实现:内置了Function Calling框架,支持注册自定义工具

Q5:代码题 - 链表反转(LeetCode 206)+ 追问K个一组反转(LeetCode 25)

回答思路:先写了基础链表反转(迭代),然后扩展到K个一组,使用递归+迭代结合的方式。

二面(50分钟)

Q1:Agent的响应延迟怎么优化?

回答思路:

  • 模型轻量化:简单任务用小模型,复杂任务才用大模型
  • 异步处理:工具调用异步化,非阻塞
  • 缓存机制:语义缓存(相似query命中缓存)、工具结果缓存
  • 流式输出:生成过程实时返回
  • 预计算:System Prompt的KV Cache预热

Q2:讲讲你做过的一个完整Agent项目

回答思路:讲了一个企业内部的IT运维Agent。能处理服务器告警、执行诊断命令、生成故障报告。详细讲了工具设计(SSH执行器、监控API、日志查询)、权限控制、安全隔离。

Q3:大模型的复读问题怎么解决?

回答思路:

  • 采样层面:Repetition Penalty(对已出现token降低概率)、Frequency/Presence Penalty
  • 训练层面:数据去重,避免重复模式在训练数据中出现
  • 后处理:检测连续重复并截断
  • 根本原因:attention倾向于近期token,形成正反馈循环

Q4:MoE模型如何扩大参数但不增推理成本?

回答思路:

  • 多个Expert FFN + Router网络
  • 每次只激活top-k个Expert(如Mixtral激活2/8)
  • 总参数虽大但单次推理的FLOPs与一个Expert的Dense模型接近
  • 挑战:负载均衡(auxiliary loss)、Expert坍缩、通信开销
  • DeepSeek V3用了细粒度的MoE(256个小Expert选8个)

Q5:代码题 - 全排列(LeetCode 46)

回答思路:回溯法,used数组标记。

三面(VP面,35分钟)

Q1:你怎么看AI Agent在企业场景的商业价值?

回答思路:降低人力成本(客服、运维)、提升效率(知识管理、流程自动化)、创造新价值(智能分析、决策辅助)。用具体数据说明ROI。

Q2:你对百度AI战略的理解?

回答思路:从搜索到AI全栈布局(芯片/框架/模型/应用),千帆平台的生态化策略,文心大模型的行业赋能。

面试体验: 百度面Agent开发岗非常看重系统设计能力,要能讲清楚一个Agent平台的完整架构。千帆平台的了解是加分项。面试节奏紧凑,每轮都有编码环节。


面经三:大模型NLP算法(校招)

面试时间: 2025年3月
岗位: NLP算法工程师 - 搜索方向
结果: 二面中

一面(60分钟)

Q1:位置编码有哪些?RoPE的优点?

回答思路:

  • 绝对位置编码:Sinusoidal(固定)、Learned(可学习)
  • 相对位置编码:Relative Position Bias、RoPE、ALiBi
  • RoPE优点:①编码相对位置 ②实现高效(逐元素旋转) ③理论上支持长度外推 ④与注意力机制天然兼容

Q2:大模型如何处理超长上下文?KIMI模型的方法你了解吗?

回答思路:

  • 位置编码扩展:YaRN、NTK-aware scaling
  • 稀疏注意力:Longformer的滑动窗口+全局attention
  • 分块处理:Ring Attention、Sequence Parallelism
  • KIMI的方法:据说使用了类似的长上下文技术,支持200k+上下文
  • 实际应用:对超长文档用RAG可能比原生长上下文更经济

Q3:模型涌现能力你怎么理解?

回答思路:

  • 定义:随模型规模增加,某些能力从无到有的突变
  • 典型例子:few-shot learning、chain-of-thought reasoning
  • 争议:BIG-bench research指出用非线性度量时涌现消失
  • 可能的解释:模型内部表征的相变、任务难度的阈值效应

Q4:百度搜索和大模型怎么结合?

回答思路:

  • Query理解增强:用LLM做query改写、意图识别
  • 摘要生成:对搜索结果做LLM总结
  • AI Search模式:直接用LLM回答问题,搜索结果做RAG来源
  • 广告优化:LLM优化广告文案和匹配

Q5:代码题 - 树的层次遍历变体(之字形遍历 LeetCode 103)

回答思路:BFS + 奇偶层反转。

二面(55分钟)

Q1:训练大模型时数据怎么处理?清洗、配比、格式?

回答思路:

  • 清洗:去重(MinHash/SimHash)、去噪(语言检测、质量打分)、去毒(有害内容过滤)
  • 配比:不同来源(网页/书籍/代码/学术)按比例混合
  • 格式:预训练用纯文本,SFT用instruction格式(alpaca/sharegpt)
  • 数据质量评估:用小模型做质量打分、人工抽检

Q2:大模型的工具调用准确率不高怎么优化?

回答思路:

  • 工具描述优化:清晰的功能说明+参数说明+示例
  • SFT数据增强:构造更多工具调用训练样本
  • 验证步骤:生成工具调用后先校验参数合法性
  • 动态工具选择:根据query先过滤不相关的工具
  • 失败重试:工具调用失败后让LLM分析原因并重试

Q3:Agent的Planning能力怎么评测?

回答思路:

  • 任务完成率:是否最终完成了目标任务
  • 步骤效率:实际步骤数 vs 最优路径步骤数
  • 工具选择准确率:选择了正确的工具
  • 规划合理性:人工评估规划方案的逻辑性
  • Benchmark:WebArena、AgentBench等标准评测集

Q4:代码题 - 实现简单的注意力机制(用PyTorch)

回答思路:实现了scaled dot-product attention和multi-head attention,包括Q/K/V投影、缩放点积、softmax和输出投影。

面试体验: 百度NLP搜索方向面试会结合搜索业务场景出题,要思考大模型和搜索的结合方式。代码题除了LeetCode还有模型实现题(手写Attention/Tokenizer),这是百度面试的特色。


面经四:大模型应用开发(实习)

面试时间: 2024年7月
岗位: 大模型应用开发实习生
结果: 已offer

一面(45分钟)

Q1:RAG的核心原理?和直接用大模型回答有什么区别?

回答思路:

  • RAG = 检索 + 生成,先从知识库检索相关文档,再让LLM基于检索结果生成答案
  • 与直接回答的区别:减少幻觉(有据可查)、知识实时更新(不需重新训练)、可溯源
  • 局限:检索质量影响最终效果、增加延迟、需要维护知识库

Q2:Python装饰器原理?写一个计时装饰器

回答思路:装饰器本质是接受函数作为参数返回新函数的高阶函数。写了@functools.wraps的计时装饰器。

Q3:生成器和迭代器的区别?

回答思路:

  • 迭代器:实现__iter__和__next__方法的对象
  • 生成器:用yield关键字的函数,是迭代器的简便实现
  • 生成器惰性求值,节省内存
  • 应用:处理大文件、数据流

Q4:你用过什么Agent框架?LangChain和LlamaIndex的区别?

回答思路:

  • LangChain:通用的LLM应用框架,链式调用,Agent/Tool/Memory体系完善
  • LlamaIndex:专注于数据索引和检索,RAG能力更强
  • LangChain适合Agent开发,LlamaIndex适合知识库问答
  • 近期趋势:LangGraph做工作流编排越来越流行

Q5:代码题 - 二分查找变体(旋转排序数组搜索 LeetCode 33)

回答思路:二分查找,先判断哪半边有序,再确定目标在哪半边。

二面(40分钟)

Q1:讲讲你的项目经验

回答思路:讲了一个基于LangChain的多轮对话RAG系统。

Q2:你对千帆平台的了解?用过吗?

回答思路:了解千帆提供模型推理API、模型微调、知识库管理等功能。实际调用过文心一言的API做过小项目。

Q3:你的职业规划?

回答思路:实习期间深入学习大模型应用开发,毕业后希望在AI Agent方向深耕。

面试体验: 百度实习面试相对正式岗位简单一些,但还是会考基础知识和编码能力。了解千帆平台并有实际使用经验会是加分项。实习面试2轮技术面即可,不需要三面。


面经五:AI Agent / 大模型应用开发(2026 新增公开来源)

来源:牛客、小红书公开页面;以下为摘要索引,完整内容请查看来源链接。

来源 标题 核心考点
小红书 百度 大模型应用开发 一面面经(小红书站内搜索原标题) 多模态 RAG、表格切片、Memory 总结、Function Call、Redis 语义缓存、Session
牛客 百度 AI Agent 开发 二面 LangChain、LangGraph、Tool、Retriever、Memory、微调参数
牛客 百度 Agent 面经 LangGraph、checkpoint、memory、sandbox、monitoring、skill 化、RAG
牛客 大模型、Agent面经总结【04/28】腾讯 / 百度 总结 百度 AI 大模型产品、生态集成、Agent/工具调用、向量检索

2026 高频追问

  1. 长表格跨 chunk 如何保留表头和语义?扫描 PDF 与结构化表格如何处理?

  2. 多模态 RAG 中视觉 embedding 什么时候有价值?

  3. Memory 总结何时触发?如何避免摘要丢失关键信息?

  4. Redis 语义缓存如何判断相似问法命中?如何避免错误缓存污染?

  5. LangGraph checkpoint 恢复如何保证幂等?监控与沙箱如何闭环?


总结与建议

百度面试特点

  1. 理论深度极深:Transformer、RLHF、位置编码等会追问到数学公式级别

  2. 手写代码是特色:除了LeetCode还会要求手写Tokenizer/Attention等模型代码

  3. 必问文心一言:一定要提前用文心一言/千帆平台,能给出客观评价

  4. Agent设计题:从0到1设计Agent系统是高频题

  5. 算法题偏重DP和数据结构:股票系列、树、链表是常见类型

准备建议

  1. 能手写BPE Tokenizer和Multi-Head Attention的PyTorch代码

  2. RLHF/DPO/PPO的完整流程和数学公式要烂熟于心

  3. 提前体验文心一言和千帆平台,准备客观的产品评价

  4. 准备一个Agent项目,能讲清楚从设计到部署的完整链路

  5. 算法题重点刷DP类(股票系列)和手写模型代码

  6. 关注百度在AI搜索和Agent领域的最新动态