商汤科技 AI Agent 工程师 - 面试题 & 面经
Q: 多模态 Agent 如何融合视觉、语言、语音等多种模态信息做决策?
💡 思考逻辑: 商汤是视觉AI公司,面试官考察你对多模态融合的技术理解。
参考答案: 多模态融合策略:1)早期融合(Early Fusion)——将不同模态的 raw features 拼接后输入单一模型,如 GPT-4V/Gemini 的做法,优势是跨模态交互充分,劣势是对模型要求高;2)晚期融合(Late Fusion)——各模态独立处理后在决策层融合,如视觉模型生成图像描述 → 与文本一起传给 LLM,优势是模块化强、可替换,劣势是跨模态信息丢失;3)混合融合——关键模态做早期融合(视觉+语言),辅助模态做晚期融合(音频、传感器)。Agent 架构中的实现:Perception Layer(多模态编码器)→ Fusion Layer(跨模态注意力/Cross-Attention)→ Reasoning Layer(LLM 推理)→ Action Layer(工具调用)。商汤的日日新大模型走的是原生多模态路线。
Q: 具身智能(Embodied AI)中 LLM Agent 如何与物理世界交互?有哪些核心挑战?
💡 思考逻辑: 商汤在具身智能领域投入大,面试官考察你对 LLM + 机器人交叉领域的理解。
参考答案: 具身智能中 LLM Agent 的角色:1)高层规划——用户说'帮我做一杯咖啡',LLM 分解为子任务序列(走到咖啡机 → 拿杯子 → 放入咖啡豆 → 按按钮 → 等待 → 端到桌上);2)场景理解——通过机器人视觉识别物体位置、状态(咖啡机在哪?杯子在哪个柜子?);3)动作翻译——将 LLM 的自然语言指令转为机器人可执行的动作序列(move_to(x,y) → grip(cup) → place(cup, machine))。核心挑战:1)实时性——物理世界不等人,机器人需要毫秒级反应,LLM 太慢;2)安全——机器人的物理动作不可逆(打碎杯子),需要安全约束层;3)Grounding Gap——LLM 对物理世界的理解来自文本训练,缺乏真正的物理常识(不知道杯子倒过来水会撒);4)Sim-to-Real Gap——仿真环境训练的策略迁移到真实环境效果下降。
Q: 如何设计视觉大模型的 Agent 应用?如何让模型理解并操作 GUI 界面?
💡 思考逻辑: GUI Agent 是当前热点方向,面试官考察你对视觉模型 + Agent 结合的前沿理解。
参考答案: GUI Agent 设计:1)视觉感知——截取屏幕图像,用 VLM(如 SeeClick/CogAgent)识别 UI 元素(按钮、输入框、菜单、文字),生成 UI 元素树或坐标标注;2)意图理解——用户说'帮我在淘宝搜索无线耳机',Agent 理解为需要打开淘宝 → 找到搜索框 → 输入关键词 → 点击搜索;3)动作执行——将 LLM 的决策转化为 GUI 操作(click(x,y)、type(text)、scroll(direction)、swipe(start, end));4)状态验证——执行后再次截屏,验证操作是否成功(搜索框是否出现了输入的文字?页面是否跳转?)。核心难点:1)动态页面——加载动画、弹窗等干扰识别;2)坐标精度——VLM 预测的点击坐标偏移导致点错位置;3)多步推理——长任务链中错误会累积。商汤的 InternVL 系列在 GUI 理解上表现出色。
Q: 视觉 Agent 的评估体系与纯文本 Agent 有何不同?需要额外考虑什么?
💡 思考逻辑: 商汤做视觉模型,面试官考察你对视觉 Agent 特殊评估需求的理解。
参考答案: 视觉 Agent 额外评估维度:1)视觉 Grounding 准确率——模型定位的 UI 元素/物体 bounding box 是否正确(IoU 指标);2)空间推理——理解物体的相对位置关系('在按钮的右边');3)OCR 准确率——截图中文字识别是否正确(特别是小字体、艺术字体);4)多帧一致性——视频/动态场景中能否跨帧追踪同一物体;5)操作成功率——GUI 场景下每步操作是否真正生效(点击是否命中了目标元素);6)视觉幻觉——看到图中不存在的物体或误读文字。评估方法:1)Benchmark——ScreenSpot(GUI 定位)、MMMU(多模态理解)、VisualWebArena(网页操作);2)自动化测试——录制标准操作流程,对比 Agent 的操作序列与标准答案;3)人工评估——复杂场景仍需人工判断输出质量。
Q: 如何训练一个多模态 Agent?数据如何收集和标注?
💡 思考逻辑: 商汤有强大的数据标注能力,面试官考察你对训练数据工程的理解。
参考答案: 多模态 Agent 训练数据链路:1)数据类型——指令-操作对(用户指令 → Agent 应执行的动作序列),包括文本指令、对应的图像/视频、标注的操作序列;2)数据收集——a)人工标注:标注员执行任务时录制操作过程;b)程序生成:在模拟环境中自动生成任务-操作对;c)LLM 合成:用强模型生成指令 → 弱模型执行 → 强模型判断正确性(Self-Play);d)线上数据回流:生产环境中用户确认的成功操作;3)训练流程——a)预训练:在大量图文对上训练视觉-语言对齐;b)SFT:在指令-操作数据上做监督微调;c)RLHF/DPO:用人类偏好数据做对齐训练;4)挑战——多模态标注成本极高(一条视频标注可能需要 10-30 分钟),需要高效的标注工具和众包平台。商汤自建了大规模标注平台(EasyData)支撑数据生产。