腾讯 AI Agent/大模型岗位 - 真实面经网络实录
整理自牛客、脉脉、CSDN等平台的真实面试分享,2024-2025年
面经一:大模型算法工程师(社招)
面试时间: 2024年11月
岗位: 大模型算法工程师 - 混元大模型团队
结果: 已offer
一面(基础模型与方法,60分钟)
Q1:LLaMA2和LLaMA1的主要区别和改进?
回答思路:
- GQA替代MHA:降低KV Cache显存占用
- 上下文长度从2048扩展到4096
- 训练数据量增加40%(2T tokens)
- RMSNorm替代LayerNorm
- SwiGLU激活函数替代ReLU
- 增加了RLHF对齐训练(LLaMA2-Chat)
Q2:LoRA的原理详细讲一下?秩r怎么选?
回答思路:
- 冻结预训练权重W,学习低秩更新 ΔW = BA
- B∈R^(d×r), A∈R^(r×k),r << min(d,k)
- B零初始化,A正态初始化→初始时ΔW=0
- r的选择:通常4-64,8-16是常用范围
- 经验法则:任务越复杂/数据越多,r可以适当大一些
- QLoRA:在量化模型上做LoRA,进一步减少显存
Q3:混合精度训练(FP16/BF16/FP8)的优缺点?
回答思路:
- FP16:范围小(±65504)容易溢出,需要loss scaling
- BF16:范围与FP32相同,不需要loss scaling,但精度略低
- FP8:更激进的量化,推理用多,训练中尚不成熟
- 通常做法:计算用BF16/FP16,master weights保持FP32
- 好处:显存减半,计算速度提升(Tensor Core加速)
Q4:Pretrain + SFT + RLHF三阶段各自的目标是什么?
回答思路:
- Pretrain:学习语言分布和世界知识(next token prediction)
- SFT:学习指令跟随能力和对话格式
- RLHF:与人类偏好对齐,减少有害输出,提升有用性
- 数据量级:Pretrain用TB级,SFT用万级,RLHF用千级
Q5:代码题 - 最小覆盖子串(LeetCode 76)
回答思路:滑动窗口+哈希表,O(n)。这是一道Hard题,花了约20分钟。
二面(底层优化与推理效率,55分钟)
Q1:KV Cache压缩有哪些方法?各自的trade-off?
回答思路:
- 架构层面:GQA/MQA减少KV头数
- 量化:KV Cache量化到INT8/INT4
- 驱逐:H2O(保留重要token的KV)、StreamingLLM(保留attention sink + 最近窗口)
- 低秩压缩:MLA(DeepSeek V2)
- 共享:跨层KV Cache共享
- Trade-off:压缩越激进,精度损失越大但显存节省越多
Q2:PagedAttention和FlashAttention的设计思路?适用场景?
回答思路:
- FlashAttention:利用GPU SRAM做分块计算,减少HBM读写→降低IO瓶颈,加速训练和推理
- PagedAttention:将KV Cache分页管理(类似OS虚拟内存),减少显存碎片→提升serving吞吐
- FlashAttention关注单次attention的计算效率
- PagedAttention关注多请求并发时的显存利用率
- 两者可以结合使用(vLLM中同时用)
Q3:张量并行和流水线并行怎么实现?各自的瓶颈?
回答思路:
- 张量并行(TP):将权重矩阵按行/列切分到多卡,每层需要AllReduce通信
- 流水线并行(PP):将模型按层切分,不同层在不同卡,micro-batch流水化
- TP瓶颈:层内通信频繁,适合同节点多卡
- PP瓶颈:bubble time(流水线气泡),需要careful的micro-batch调度
- 通常TP在节点内,PP在节点间
Q4:如果在多卡GPU上训练70B模型,你怎么设计训练策略?
回答思路:
- 硬件假设:8×A100 80GB(单节点)或多节点
- 方案:TP=8(节点内)+ PP=2-4(跨节点)+ ZeRO-1 DP
- 混合精度BF16,梯度检查点
- Micro-batch size调整避免OOM
- 通信:NCCL,计算和通信overlap
- 监控:loss曲线、梯度范数、GPU利用率
Q5:手写Multi-Head Attention的前向计算
回答思路:写了完整的PyTorch代码,包括Q/K/V线性变换、reshape成多头、scaled dot-product attention、concat和输出投影。
三面(综合能力与场景设计,50分钟)
Q1:灾难性遗忘怎么解决?EWC、LwF、重放机制分别是什么?
回答思路:
- EWC(弹性权重巩固):计算Fisher Information Matrix,对重要参数施加正则约束
- LwF(Learning without Forgetting):用旧模型输出做知识蒸馏
- 重放机制:保留部分旧数据在新任务训练中混入
- 实际中最常用的是重放+LoRA的组合方案
Q2:GraphRAG和传统RAG的区别?
回答思路:
- 传统RAG:基于chunk的平面检索,适合简单的事实问答
- GraphRAG:用知识图谱/社区图索引文档关系,支持多跳推理和全局摘要
- GraphRAG优势:跨文档推理、全局理解、关系查询
- GraphRAG劣势:索引构建成本高、图构建质量依赖LLM
- 微软GraphRAG的两阶段:Global Search(社区级摘要)和Local Search(实体级检索)
Q3:设计一个金融领域智能助手的RAG流水线
回答思路:
- 数据层:金融报告PDF解析(表格+文字)、实时行情API、监管法规库
- 检索层:混合检索(BM25 + Dense + 知识图谱),按时效性加权
- 重排层:Cross-Encoder Reranker,金融实体识别做boost
- 生成层:选择金融领域微调过的模型,System Prompt中注入合规约束
- 安全层:数字准确性校验、合规性审查、免责声明自动添加
- 评估:金融QA benchmark + 人工评测准确率和合规性
Q4:大模型在业务中的痛点?如何优化?
回答思路:
- 成本:模型路由(简单query用小模型)、KV Cache优化、语义缓存
- 幻觉:RAG+事实核查、CoT推理、confidence calibration
- 延迟:投机解码、量化、流式输出
- 对齐:持续的RLHF/DPO训练、红队测试
Q5:代码题 - 正则匹配(LeetCode 10)
回答思路:动态规划,dp[i][j]表示s前i个字符和p前j个字符是否匹配。处理'.'和'*'两种特殊字符。Hard题。
面试体验: 腾讯面试三轮层层递进:一面考基础、二面考工程底层、三面考综合设计。整体难度较高,尤其是代码题(两道Hard)。面试官很专业,会引导你思考。混元团队对底层优化(FlashAttention、并行训练)的要求很高。
面经二:AI Agent开发工程师(校招)
面试时间: 2025年2月
岗位: AI Agent开发 - 腾讯元宝团队
结果: 已offer
一面(55分钟)
Q1:腾讯元宝用过吗?和ChatGPT/文心一言相比有什么特点?
回答思路:用过。讲了元宝的联网搜索能力、文件处理能力、以及混元模型的中文理解优势。客观评价了各家产品的优劣。
Q2:Agent系统设计 - 如何设计一个智能文档助手?
回答思路:
- 输入:支持PDF/Word/Excel等多格式文档上传
- 文档处理Agent:解析文档结构(标题、段落、表格、图片)
- 索引构建Agent:语义分块+向量化+元数据索引
- 问答Agent:多轮对话式的文档问答
- 写作Agent:基于文档内容生成摘要、报告、PPT大纲
- 统一记忆层:跨文档的知识关联
Q3:你怎么看Agent的安全边界问题?
回答思路:
- 定义清晰的Action Space:Agent只能执行预定义的操作
- 分级权限:读操作自由,写操作需确认,危险操作需人工审批
- 沙箱执行:代码执行类Agent在隔离环境运行
- 输入验证:防止Prompt注入和越权操作
- 审计日志:所有Agent操作记录可追溯
Q4:大模型上线后怎么监控和评估?
回答思路:
- 在线指标:QPS、延迟(p50/p95/p99)、错误率、GPU利用率
- 质量指标:用户满意度(thumbs up/down)、二次提问率、人工抽检结果
- 安全指标:有害输出率、幻觉率、敏感内容检出率
- 告警机制:异常流量、延迟spike、GPU OOM
- 工具:Prometheus + Grafana + ELK
Q5:代码题 - 二叉树的序列化和反序列化(LeetCode 297)
回答思路:BFS序列化,前序遍历也可以。用"null"标记空节点。
二面(50分钟)
Q1:Agentic Workflow设计中,如何处理工具调用失败的情况?
回答思路:
- 重试策略:指数退避重试(最多3次)
- 降级方案:换用备选工具或方法
- 回退机制:回到规划阶段重新规划路径
- 人工介入:超过重试次数后通知用户选择
- 幂等性保证:重试不会产生副作用
Q2:如何优化Agent的响应延迟?
回答思路:
- 模型侧:用更小的模型做简单任务(路由分级)、量化推理
- 系统侧:异步工具调用、流式输出、预计算
- 缓存:语义缓存(相似query直接返回)、工具结果缓存
- 架构:微服务化,各Agent独立扩缩容
Q3:你对腾讯混元大模型的了解?有什么优势?
回答思路:腾讯自研大模型,中文理解能力强,在多个benchmark上表现良好。混元的MoE版本在效率上有优势。结合微信生态(文档、搜索、对话)有独特的数据优势。
Q4:场景题 - 设计微信群里的AI助手
回答思路:
- @提问模式:被@时回答问题
- 群摘要:自动生成群聊摘要(每日/按需)
- 信息提取:从群聊中提取待办事项、会议安排
- 安全边界:不能主动发送消息、不存储敏感信息、遵循群规
- 技术实现:流式处理群消息、意图检测、上下文窗口管理
Q5:代码题 - 实现前缀树Trie(LeetCode 208)
回答思路:标准Trie实现,insert/search/startsWith三个方法。
三面(总监面,35分钟)
Q1:你觉得AI Agent的终极形态是什么?
回答思路:终极形态是"数字员工"——能理解复杂目标、自主规划和执行、从经验中学习改进。但还需要解决可靠性、安全性、成本等问题。短期内更可能是human-in-the-loop的协作模式。
Q2:如果入职后你要做的第一个项目失败了,你会怎么应对?
回答思路:分析失败原因(技术/需求/资源),总结经验教训,调整方案快速迭代。强调失败是学习的机会。
面试体验: 腾讯Agent方向面试偏实际应用和系统设计,不太考深层模型原理,更看重你对产品的理解和工程能力。如果面元宝团队,一定要提前体验腾讯元宝产品。面试官风格比较友好,会跟你讨论而不是单纯拷问。
面经三:大模型推理优化工程师(社招)
面试时间: 2024年9月
岗位: 大模型推理优化 - TEG
结果: 二面挂
一面(60分钟)
Q1:vLLM的架构你了解多少?Continuous Batching是什么?
回答思路:
- Continuous Batching:不等一个batch全部完成再处理下一个,而是不断地加入新请求、移出已完成请求
- 相比Static Batching提升吞吐2-3x
- vLLM架构:Scheduler + PagedAttention + Worker
- Scheduler负责请求调度和KV Cache分配
Q2:模型量化你做过什么?GPTQ和AWQ的区别?
回答思路:
- GPTQ:基于OBS的逐层量化,用Hessian信息最小化量化误差
- AWQ:基于激活感知,保护重要权重(根据激活分布判断重要性)
- GPTQ需要校准数据,AWQ也需要但对数据量要求更低
- 效果:两者在INT4下都能保持不错精度,AWQ通常略好
Q3:投机解码的原理和适用场景?
回答思路:
- Draft-then-verify范式:小模型快速生成多个候选token,大模型一次性验证
- 接受率取决于draft和target模型的分布一致性
- 适用场景:target模型很大、延迟敏感、有好的draft模型
- 加速比:通常1.5-3x,取决于接受率
Q4:CUDA编程了解吗?warp和block的概念?
回答思路:
- Thread→Warp(32个线程)→Block→Grid
- Warp是GPU执行的最小单位,同一warp内的线程执行相同指令
- Shared Memory在Block内共享,比Global Memory快100x
- FlashAttention就是精心设计了thread block和shared memory的使用
Q5:代码题 - 手写位置编码(Sinusoidal Positional Encoding)
回答思路:用PyTorch实现,正弦和余弦交替编码不同维度的位置信息。
二面(55分钟)
Q1:如何优化一个大模型推理服务的首token延迟(TTFT)?
回答思路:
- Prefill阶段优化:FlashAttention减少计算量
- KV Cache预热:对系统prompt预计算KV Cache
- 并行Prefill:将长prompt分块并行处理
- 硬件:使用更多GPU做tensor parallel
- 实际经验分享:把7B模型TTFT从200ms优化到80ms
Q2:大模型推理中的内存瓶颈分析?
回答思路:
- 模型权重:固定占用,INT4量化可减少4x
- KV Cache:随序列长度线性增长,是serving的主要瓶颈
- 激活值:Prefill阶段的中间激活
- 通信buffer:多卡推理的通信缓冲
- 优化方向:KV Cache压缩(量化/稀疏)+ 模型量化 + 精细的显存管理
Q3:你觉得大模型推理的未来发展方向是什么?
回答思路:硬件(专用推理芯片)、算法(更高效的注意力机制)、系统(更智能的调度和缓存)、模型(MoE等稀疏激活架构)。
面试体验: 推理优化岗位要求非常硬核,需要了解GPU架构、CUDA编程、系统优化等底层知识。如果没有实际做过推理优化的工作,建议先去实践一下vLLM/TGI的部署和调优。挂在二面,反馈是CUDA底层经验不足。
面经四:AI 应用开发 / Agent 开发(2026 新增公开来源)
来源:牛客、小红书公开页面;以下为摘要索引,完整内容请查看来源链接。
| 来源 | 标题 | 核心考点 |
|---|---|---|
| 小红书 | 腾讯ai应用一面面经(小红书站内搜索原标题) | 多 Agent 协作、AgentContext、Run Trace、Skills、上下文注入、风控 Agent |
| 小红书 | 腾讯 Agent二面凉经带答案(小红书站内搜索原标题) | Agent 二面深挖、工程化追问 |
| 小红书 | 腾讯 ai 应用开发 一面(小红书站内搜索原标题) | AI 应用开发一面、项目深挖 |
| 牛客 | 大模型、Agent面经总结【04/28】腾讯 / 百度 总结 | Agent 编排、RAG 热更新、失败重试、金融安全、LoRA/DPO、向量检索 |
| 牛客 | 腾讯 AI Agent 应用开发一面凉经 | Coding Agent、Claude Code 对比、SubAgent、上下文摘要、GRPO/QLoRA、AI 工具边界 |
| 牛客 | 字节、蚂蚁、腾讯 Agent 实习面经 | 调剂岗位后的算法与场景题考察差异 |
2026 高频追问
-
6 类 Agent 如何协作?上下文、状态和工具调用结果如何共享?
-
如何避免历史消息撑爆上下文?Run Trace 什么时候保存,保存哪些字段?
-
Agent 失败重试如何设计,尤其是金融/高风险场景如何保证安全?
-
RAG 知识库如何不停服热更新?更新期间如何保证检索一致性?
-
Skill 如何动态加载,同时保证稳定性和权限边界?
-
自研 Coding Agent 与 Claude Code 的核心差异和真实优势是什么?
-
SubAgent 通信、分层上下文和摘要质量如何验证?
总结与建议
腾讯面试特点
-
三轮技术面层次分明:基础→底层→综合,难度递增
-
代码题偏难:Hard级别的题经常出现
-
项目深挖:会追问技术选型的原因和trade-off
-
产品意识考察:了解腾讯产品(混元、元宝)是加分项
-
开放性问题:会问你对行业趋势的看法
准备建议
-
LeetCode以Medium为主、Hard也要准备一些(尤其是字符串和DP)
-
了解腾讯混元大模型的技术特点和应用场景
-
体验腾讯元宝产品,准备好对比分析
-
如果面推理优化方向,FlashAttention/PagedAttention原理要精通
-
准备一个自己从0到1做的完整项目,能讲清楚每个环节