Skip to main content

Agent 工程师面试,三轮分别考什么?

· 8 min read

面试官三轮的真实考察点,不是会调 API

  1. 一面(项目深挖,70 分钟):从短期记忆到长期记忆、从成本控制到模型选型,全程追问项目细节,无八股文
  2. 二面(系统设计):从 0~1 搭一套商用 Agent 系统,边画架构图边追问落地细节
  3. 三面(认知面/定级面):聊赛道判断、个人差异化、1-2 年内行业瓶颈预测
  4. 面试官要的不是会调框架的人:要的是做稳定、做可控、上线不出事的人
  5. 新人别只写 demo:先把 token 机制、注意力机制这些底层搞清,再做有工程细节的完整项目

1. 面试三轮的核心定位

Agent 工程师面试和普通业务后端面试的逻辑完全不一样。普通业务面试还能问点八股文撑场面,Agent 面试几乎每个问题都从你简历上写的项目出发,连环追问到你答不上来为止。

三轮的角色分工很清晰:

轮次角色核心目的时长
一面业务开发 / 同级工程师验证项目真伪 + 基本工程能力60-90 分钟
二面技术总监 / 架构师验证系统设计 + 工程思维60-90 分钟
三面业务负责人验证认知 + 定级(配不配得上高薪)30-50 分钟

三轮筛的是不同维度的能力。任何一轮出现"明显背过答案但说不清细节",基本就挂了——这是 Agent 面试和八股文面试最大的区别。


2. 一面:项目深挖

一面没有自我介绍寒暄,30-40 秒开场就直接进项目追问。每一道题都从你简历上的项目出发,没有一道是脱离项目独立存在的。

2.1 短期记忆:会话窗口选型

  • 你用的是 message window(按消息条数截断)还是 token window(按 token 总量截断)?线上为什么这么选?
  • Redis 持久化时,会话过期策略怎么定的?遇到过并发写冲突吗?

这个问题考察的不是"你知道这两种窗口",而是你在线上跑过没。没跑过的人会回答"我们用的 message window,因为它简单",跑过的人会讲为什么在长上下文场景下 token window 更合理、并发写怎么用乐观锁或分布式锁处理。

2.2 长期记忆:向量库检索精度

  • 长期记忆用向量库存储,记忆越来越多后检索越来越不准,怎么优化的?
  • 上下文 token 溢出的兜底方案是什么?

记忆库膨胀是 LLM 应用最常见的工程问题。能答上"定期重写压缩"、"向量库 + 关键词混合检索"、"过期记忆淘汰策略"才算过了基础线。答不上来基本说明项目是 demo 级别。

2.3 成本控制

  • 单用户日均 token 成本是多少?
  • 百万级流量下怎么控制成本?
  • 有没有做过调用拦截?比如用户恶意刷长文本怎么限制?

这个问题直接筛掉两类人:没做过成本核算的(说明没真正上线)、没考虑过恶意流量的(说明没考虑过安全和稳定性)。

2.4 模型选型

  • 这个场景你为什么用基座模型而不是微调?
  • 模型选型的时候拿什么数据做判断?

能讲清楚"为什么这个场景不需要微调"或者"我们用业务评测集 + 延迟 + 成本三维度做选型"才算到位。只说"基座模型效果够用"会被继续追问到答不出来。

2.5 线上故障排查

面试官会从你提到的某个"线上问题"开始追问,一直追到具体改了哪块逻辑、效果提升了多少百分比

模糊回答 = 直接扣分

中间如果有一道题答得很含糊(比如"我们做了优化,效果还可以"),面试官会连续追问三个问题,直到你说出具体的改动点和量化数据。这种题答不清楚,会直接影响一面通过率。


3. 二面:从 0~1 搭一套商用 Agent 系统

二面是技术总监面,全程让你共享屏幕画架构图,边画边问。核心不是"你会调框架",核心是"你能不能把东西做稳定、做可控、上线不出事"。

3.1 模块拆分

  • 系统模块怎么拆?每个模块的职责是什么?
  • 模块之间用什么通信?为什么这么拆?

考察的是架构能力——能不能给出"边界清晰、可独立演进、可灰度的模块划分",而不是把所有逻辑塞在一个文件里。

3.2 任务调度

  • 用户发一个需求过来,怎么判断是单工具能解决的简单任务,还是多步拆解的复杂任务?
  • 拆解的力度怎么控制?拆得太细浪费 token,拆得太粗效果差。

这个问题背后的工程矛盾:拆解粒度直接决定成本和成功率。好的回答会给出"复杂度评估器 + 动态拆解"的设计,而不是硬编码拆解模板。

3.3 异常容错

任务执行到一半,某一步失败了,怎么判断是重试、回滚,还是重新规划?触发条件分别是?

关键判断:重试有成本上限(最多 N 次)、回滚有状态保存点、重新规划要有"已知失败原因"作为输入。三者不能混着用。

3.4 多工具联动与风控

  • 检索、关键词检索、代码解析这些工具怎么配合?
  • 工具调用的权限怎么管控?怎么防止用户通过 Agent 越权操作?

这个问题的本质是安全边界。Agent 天然有"代替用户执行操作"的能力,权限管控没设计好,用户可以通过 prompt 注入让 Agent 执行越权操作。能讲清楚"工具级权限矩阵 + 操作审计 + prompt 注入检测"才算到位。


4. 三面:认知和判断

三面是定级面,几乎不问代码。聊的是赛道认知、个人差异化和行业判断。

4.1 赛道判断

  • 你是怎么看 Agent 这个赛道的?长期风口还是短期热点?
  • 长期落地的方向有哪些?

这种问题没有标准答案,考察的是你有没有自己的思考框架,而不是背一份行业报告。

4.2 个人差异化

  • 你做了这么多 Agent 项目,和市面上普通的大模型开发者比,核心竞争力在哪?

这个问题其实是在问"你凭什么拿这个级别的薪资"。回答要落到具体的能力差异(比如"我做过完整的工程化项目,不只是 demo"、"我能在 0~1 阶段独立把产品跑通"),不能讲空话。

4.3 行业瓶颈预测

  • 1-2 年内 Agent 最大的瓶颈在哪?是模型能力还是工程能力?
  • toB 还是 toC,哪个会先跑通?

考察的是你对行业演进的判断力。能讲清楚"模型能力短期不是瓶颈,工程化和场景化才是"会比讲"模型越来越强"的答案高一个层级。

4.4 从 0~1 带业务线

  • 如果让你从 0~1 带一条 Agent 业务线,从招人到落地商业化,第一步做什么?

这是在考 lead 能力。回答要落到"先做什么、后做什么、为什么这么排",不是讲一通大词。


5. 给 Agent 新人的建议

面试官三轮下来筛掉的,主要是只写过 demo 的人。常见误区有三个:

  1. 天天写 hello world:抱着 LangChain 入门教程写完就跑,根本没碰过线上问题。
  2. 底层机制不熟:token 机制、注意力机制、上下文窗口限制都讲不清,被追问就露馅。
  3. 项目没坑点总结:简历上写"做过 RAG 项目",但问"召回率怎么优化的"就答不上来。

正确路径是先打底层逻辑再碰大模型:

阶段重点产出物
第一步token 机制、注意力机制、上下文窗口限制能讲清模型输入输出的所有限制
第二步写一个有工程细节的完整项目含成本核算、稳定性设计、线上故障案例
第三步把项目的坑点和踩过的雷总结成文档面试时直接拿这些案例回答追问

核心结论:Agent 面试不是"你会调 LangChain 就行",而是"你做过完整的、有工程细节的、踩过坑的项目"。能讲清楚一次线上故障的具体修复过程,比背一百道八股文有用得多。


References

  1. 大模型面试感受 —— 军哥程序员