腾讯 AI Agent/大模型岗位 - 真实面经网络实录

整理自牛客、脉脉、CSDN等平台的真实面试分享,2024-2025年


面经一:大模型算法工程师(社招)

面试时间: 2024年11月
岗位: 大模型算法工程师 - 混元大模型团队
结果: 已offer

一面(基础模型与方法,60分钟)

Q1:LLaMA2和LLaMA1的主要区别和改进?

回答思路:

  • GQA替代MHA:降低KV Cache显存占用
  • 上下文长度从2048扩展到4096
  • 训练数据量增加40%(2T tokens)
  • RMSNorm替代LayerNorm
  • SwiGLU激活函数替代ReLU
  • 增加了RLHF对齐训练(LLaMA2-Chat)

Q2:LoRA的原理详细讲一下?秩r怎么选?

回答思路:

  • 冻结预训练权重W,学习低秩更新 ΔW = BA
  • B∈R^(d×r), A∈R^(r×k),r << min(d,k)
  • B零初始化,A正态初始化→初始时ΔW=0
  • r的选择:通常4-64,8-16是常用范围
  • 经验法则:任务越复杂/数据越多,r可以适当大一些
  • QLoRA:在量化模型上做LoRA,进一步减少显存

Q3:混合精度训练(FP16/BF16/FP8)的优缺点?

回答思路:

  • FP16:范围小(±65504)容易溢出,需要loss scaling
  • BF16:范围与FP32相同,不需要loss scaling,但精度略低
  • FP8:更激进的量化,推理用多,训练中尚不成熟
  • 通常做法:计算用BF16/FP16,master weights保持FP32
  • 好处:显存减半,计算速度提升(Tensor Core加速)

Q4:Pretrain + SFT + RLHF三阶段各自的目标是什么?

回答思路:

  • Pretrain:学习语言分布和世界知识(next token prediction)
  • SFT:学习指令跟随能力和对话格式
  • RLHF:与人类偏好对齐,减少有害输出,提升有用性
  • 数据量级:Pretrain用TB级,SFT用万级,RLHF用千级

Q5:代码题 - 最小覆盖子串(LeetCode 76)

回答思路:滑动窗口+哈希表,O(n)。这是一道Hard题,花了约20分钟。

二面(底层优化与推理效率,55分钟)

Q1:KV Cache压缩有哪些方法?各自的trade-off?

回答思路:

  • 架构层面:GQA/MQA减少KV头数
  • 量化:KV Cache量化到INT8/INT4
  • 驱逐:H2O(保留重要token的KV)、StreamingLLM(保留attention sink + 最近窗口)
  • 低秩压缩:MLA(DeepSeek V2)
  • 共享:跨层KV Cache共享
  • Trade-off:压缩越激进,精度损失越大但显存节省越多

Q2:PagedAttention和FlashAttention的设计思路?适用场景?

回答思路:

  • FlashAttention:利用GPU SRAM做分块计算,减少HBM读写→降低IO瓶颈,加速训练和推理
  • PagedAttention:将KV Cache分页管理(类似OS虚拟内存),减少显存碎片→提升serving吞吐
  • FlashAttention关注单次attention的计算效率
  • PagedAttention关注多请求并发时的显存利用率
  • 两者可以结合使用(vLLM中同时用)

Q3:张量并行和流水线并行怎么实现?各自的瓶颈?

回答思路:

  • 张量并行(TP):将权重矩阵按行/列切分到多卡,每层需要AllReduce通信
  • 流水线并行(PP):将模型按层切分,不同层在不同卡,micro-batch流水化
  • TP瓶颈:层内通信频繁,适合同节点多卡
  • PP瓶颈:bubble time(流水线气泡),需要careful的micro-batch调度
  • 通常TP在节点内,PP在节点间

Q4:如果在多卡GPU上训练70B模型,你怎么设计训练策略?

回答思路:

  • 硬件假设:8×A100 80GB(单节点)或多节点
  • 方案:TP=8(节点内)+ PP=2-4(跨节点)+ ZeRO-1 DP
  • 混合精度BF16,梯度检查点
  • Micro-batch size调整避免OOM
  • 通信:NCCL,计算和通信overlap
  • 监控:loss曲线、梯度范数、GPU利用率

Q5:手写Multi-Head Attention的前向计算

回答思路:写了完整的PyTorch代码,包括Q/K/V线性变换、reshape成多头、scaled dot-product attention、concat和输出投影。

三面(综合能力与场景设计,50分钟)

Q1:灾难性遗忘怎么解决?EWC、LwF、重放机制分别是什么?

回答思路:

  • EWC(弹性权重巩固):计算Fisher Information Matrix,对重要参数施加正则约束
  • LwF(Learning without Forgetting):用旧模型输出做知识蒸馏
  • 重放机制:保留部分旧数据在新任务训练中混入
  • 实际中最常用的是重放+LoRA的组合方案

Q2:GraphRAG和传统RAG的区别?

回答思路:

  • 传统RAG:基于chunk的平面检索,适合简单的事实问答
  • GraphRAG:用知识图谱/社区图索引文档关系,支持多跳推理和全局摘要
  • GraphRAG优势:跨文档推理、全局理解、关系查询
  • GraphRAG劣势:索引构建成本高、图构建质量依赖LLM
  • 微软GraphRAG的两阶段:Global Search(社区级摘要)和Local Search(实体级检索)

Q3:设计一个金融领域智能助手的RAG流水线

回答思路:

  • 数据层:金融报告PDF解析(表格+文字)、实时行情API、监管法规库
  • 检索层:混合检索(BM25 + Dense + 知识图谱),按时效性加权
  • 重排层:Cross-Encoder Reranker,金融实体识别做boost
  • 生成层:选择金融领域微调过的模型,System Prompt中注入合规约束
  • 安全层:数字准确性校验、合规性审查、免责声明自动添加
  • 评估:金融QA benchmark + 人工评测准确率和合规性

Q4:大模型在业务中的痛点?如何优化?

回答思路:

  • 成本:模型路由(简单query用小模型)、KV Cache优化、语义缓存
  • 幻觉:RAG+事实核查、CoT推理、confidence calibration
  • 延迟:投机解码、量化、流式输出
  • 对齐:持续的RLHF/DPO训练、红队测试

Q5:代码题 - 正则匹配(LeetCode 10)

回答思路:动态规划,dp[i][j]表示s前i个字符和p前j个字符是否匹配。处理'.'和'*'两种特殊字符。Hard题。

面试体验: 腾讯面试三轮层层递进:一面考基础、二面考工程底层、三面考综合设计。整体难度较高,尤其是代码题(两道Hard)。面试官很专业,会引导你思考。混元团队对底层优化(FlashAttention、并行训练)的要求很高。


面经二:AI Agent开发工程师(校招)

面试时间: 2025年2月
岗位: AI Agent开发 - 腾讯元宝团队
结果: 已offer

一面(55分钟)

Q1:腾讯元宝用过吗?和ChatGPT/文心一言相比有什么特点?

回答思路:用过。讲了元宝的联网搜索能力、文件处理能力、以及混元模型的中文理解优势。客观评价了各家产品的优劣。

Q2:Agent系统设计 - 如何设计一个智能文档助手?

回答思路:

  • 输入:支持PDF/Word/Excel等多格式文档上传
  • 文档处理Agent:解析文档结构(标题、段落、表格、图片)
  • 索引构建Agent:语义分块+向量化+元数据索引
  • 问答Agent:多轮对话式的文档问答
  • 写作Agent:基于文档内容生成摘要、报告、PPT大纲
  • 统一记忆层:跨文档的知识关联

Q3:你怎么看Agent的安全边界问题?

回答思路:

  • 定义清晰的Action Space:Agent只能执行预定义的操作
  • 分级权限:读操作自由,写操作需确认,危险操作需人工审批
  • 沙箱执行:代码执行类Agent在隔离环境运行
  • 输入验证:防止Prompt注入和越权操作
  • 审计日志:所有Agent操作记录可追溯

Q4:大模型上线后怎么监控和评估?

回答思路:

  • 在线指标:QPS、延迟(p50/p95/p99)、错误率、GPU利用率
  • 质量指标:用户满意度(thumbs up/down)、二次提问率、人工抽检结果
  • 安全指标:有害输出率、幻觉率、敏感内容检出率
  • 告警机制:异常流量、延迟spike、GPU OOM
  • 工具:Prometheus + Grafana + ELK

Q5:代码题 - 二叉树的序列化和反序列化(LeetCode 297)

回答思路:BFS序列化,前序遍历也可以。用"null"标记空节点。

二面(50分钟)

Q1:Agentic Workflow设计中,如何处理工具调用失败的情况?

回答思路:

  • 重试策略:指数退避重试(最多3次)
  • 降级方案:换用备选工具或方法
  • 回退机制:回到规划阶段重新规划路径
  • 人工介入:超过重试次数后通知用户选择
  • 幂等性保证:重试不会产生副作用

Q2:如何优化Agent的响应延迟?

回答思路:

  • 模型侧:用更小的模型做简单任务(路由分级)、量化推理
  • 系统侧:异步工具调用、流式输出、预计算
  • 缓存:语义缓存(相似query直接返回)、工具结果缓存
  • 架构:微服务化,各Agent独立扩缩容

Q3:你对腾讯混元大模型的了解?有什么优势?

回答思路:腾讯自研大模型,中文理解能力强,在多个benchmark上表现良好。混元的MoE版本在效率上有优势。结合微信生态(文档、搜索、对话)有独特的数据优势。

Q4:场景题 - 设计微信群里的AI助手

回答思路:

  • @提问模式:被@时回答问题
  • 群摘要:自动生成群聊摘要(每日/按需)
  • 信息提取:从群聊中提取待办事项、会议安排
  • 安全边界:不能主动发送消息、不存储敏感信息、遵循群规
  • 技术实现:流式处理群消息、意图检测、上下文窗口管理

Q5:代码题 - 实现前缀树Trie(LeetCode 208)

回答思路:标准Trie实现,insert/search/startsWith三个方法。

三面(总监面,35分钟)

Q1:你觉得AI Agent的终极形态是什么?

回答思路:终极形态是"数字员工"——能理解复杂目标、自主规划和执行、从经验中学习改进。但还需要解决可靠性、安全性、成本等问题。短期内更可能是human-in-the-loop的协作模式。

Q2:如果入职后你要做的第一个项目失败了,你会怎么应对?

回答思路:分析失败原因(技术/需求/资源),总结经验教训,调整方案快速迭代。强调失败是学习的机会。

面试体验: 腾讯Agent方向面试偏实际应用和系统设计,不太考深层模型原理,更看重你对产品的理解和工程能力。如果面元宝团队,一定要提前体验腾讯元宝产品。面试官风格比较友好,会跟你讨论而不是单纯拷问。


面经三:大模型推理优化工程师(社招)

面试时间: 2024年9月
岗位: 大模型推理优化 - TEG
结果: 二面挂

一面(60分钟)

Q1:vLLM的架构你了解多少?Continuous Batching是什么?

回答思路:

  • Continuous Batching:不等一个batch全部完成再处理下一个,而是不断地加入新请求、移出已完成请求
  • 相比Static Batching提升吞吐2-3x
  • vLLM架构:Scheduler + PagedAttention + Worker
  • Scheduler负责请求调度和KV Cache分配

Q2:模型量化你做过什么?GPTQ和AWQ的区别?

回答思路:

  • GPTQ:基于OBS的逐层量化,用Hessian信息最小化量化误差
  • AWQ:基于激活感知,保护重要权重(根据激活分布判断重要性)
  • GPTQ需要校准数据,AWQ也需要但对数据量要求更低
  • 效果:两者在INT4下都能保持不错精度,AWQ通常略好

Q3:投机解码的原理和适用场景?

回答思路:

  • Draft-then-verify范式:小模型快速生成多个候选token,大模型一次性验证
  • 接受率取决于draft和target模型的分布一致性
  • 适用场景:target模型很大、延迟敏感、有好的draft模型
  • 加速比:通常1.5-3x,取决于接受率

Q4:CUDA编程了解吗?warp和block的概念?

回答思路:

  • Thread→Warp(32个线程)→Block→Grid
  • Warp是GPU执行的最小单位,同一warp内的线程执行相同指令
  • Shared Memory在Block内共享,比Global Memory快100x
  • FlashAttention就是精心设计了thread block和shared memory的使用

Q5:代码题 - 手写位置编码(Sinusoidal Positional Encoding)

回答思路:用PyTorch实现,正弦和余弦交替编码不同维度的位置信息。

二面(55分钟)

Q1:如何优化一个大模型推理服务的首token延迟(TTFT)?

回答思路:

  • Prefill阶段优化:FlashAttention减少计算量
  • KV Cache预热:对系统prompt预计算KV Cache
  • 并行Prefill:将长prompt分块并行处理
  • 硬件:使用更多GPU做tensor parallel
  • 实际经验分享:把7B模型TTFT从200ms优化到80ms

Q2:大模型推理中的内存瓶颈分析?

回答思路:

  • 模型权重:固定占用,INT4量化可减少4x
  • KV Cache:随序列长度线性增长,是serving的主要瓶颈
  • 激活值:Prefill阶段的中间激活
  • 通信buffer:多卡推理的通信缓冲
  • 优化方向:KV Cache压缩(量化/稀疏)+ 模型量化 + 精细的显存管理

Q3:你觉得大模型推理的未来发展方向是什么?

回答思路:硬件(专用推理芯片)、算法(更高效的注意力机制)、系统(更智能的调度和缓存)、模型(MoE等稀疏激活架构)。

面试体验: 推理优化岗位要求非常硬核,需要了解GPU架构、CUDA编程、系统优化等底层知识。如果没有实际做过推理优化的工作,建议先去实践一下vLLM/TGI的部署和调优。挂在二面,反馈是CUDA底层经验不足。


面经四:AI 应用开发 / Agent 开发(2026 新增公开来源)

来源:牛客、小红书公开页面;以下为摘要索引,完整内容请查看来源链接。

来源 标题 核心考点
小红书 腾讯ai应用一面面经(小红书站内搜索原标题) 多 Agent 协作、AgentContext、Run Trace、Skills、上下文注入、风控 Agent
小红书 腾讯 Agent二面凉经带答案(小红书站内搜索原标题) Agent 二面深挖、工程化追问
小红书 腾讯 ai 应用开发 一面(小红书站内搜索原标题) AI 应用开发一面、项目深挖
牛客 大模型、Agent面经总结【04/28】腾讯 / 百度 总结 Agent 编排、RAG 热更新、失败重试、金融安全、LoRA/DPO、向量检索
牛客 腾讯 AI Agent 应用开发一面凉经 Coding Agent、Claude Code 对比、SubAgent、上下文摘要、GRPO/QLoRA、AI 工具边界
牛客 字节、蚂蚁、腾讯 Agent 实习面经 调剂岗位后的算法与场景题考察差异

2026 高频追问

  1. 6 类 Agent 如何协作?上下文、状态和工具调用结果如何共享?

  2. 如何避免历史消息撑爆上下文?Run Trace 什么时候保存,保存哪些字段?

  3. Agent 失败重试如何设计,尤其是金融/高风险场景如何保证安全?

  4. RAG 知识库如何不停服热更新?更新期间如何保证检索一致性?

  5. Skill 如何动态加载,同时保证稳定性和权限边界?

  6. 自研 Coding Agent 与 Claude Code 的核心差异和真实优势是什么?

  7. SubAgent 通信、分层上下文和摘要质量如何验证?


总结与建议

腾讯面试特点

  1. 三轮技术面层次分明:基础→底层→综合,难度递增

  2. 代码题偏难:Hard级别的题经常出现

  3. 项目深挖:会追问技术选型的原因和trade-off

  4. 产品意识考察:了解腾讯产品(混元、元宝)是加分项

  5. 开放性问题:会问你对行业趋势的看法

准备建议

  1. LeetCode以Medium为主、Hard也要准备一些(尤其是字符串和DP)

  2. 了解腾讯混元大模型的技术特点和应用场景

  3. 体验腾讯元宝产品,准备好对比分析

  4. 如果面推理优化方向,FlashAttention/PagedAttention原理要精通

  5. 准备一个自己从0到1做的完整项目,能讲清楚每个环节