文章目录
-
-
- 认知、架构与项目表述
-
- 1. 自我介绍(建议控制在 2 分钟内,突出与大模型 / Agent 相关的经历)。
- 2. 简单讲一个你最有代表性的项目,你在其中解决的最关键问题是什么?追问:这个项目的整体流程是怎样的?你具体负责哪一部分、怎么做决策的?遇到的最大挑战是什么、怎么解决的?
- 3. 你如何理解 Agent?相比传统应用,它具备哪些核心能力?
- 4. AI Agent 和普通 LLM Chatbot 有什么区别?一个完整的 Agent 通常由哪些模块组成?
- 5. Agent 和传统 LLM 工作流(Workflow)的本质区别是什么?什么场景不该用 Agent?
- 6. 如果让你设计一个 Agent 应用,需要从哪些方面整体规划?如果从零设计一个 Agent,需要考虑哪些核心模块?
- 7. 画一下项目的整体架构,规划、记忆、工具和执行层分别怎么设计?项目的整体工作流是怎样的?各模块如何工作?
- 8. 讲一个你落地过的 AI Agent 项目,你在里面负责哪一层(Harness / RAG / 工具层 / 评测)?从用户一句话进来到最终调工具出结果,全链路画一遍。
- 9. 你在 Agent 项目里负责哪些模块?哪些部分是自己独立完成的?这个项目是独立完成还是参考了开源项目?
- 10. 项目中最有挑战的部分是什么?个人负责什么?最终产出如何?最大难点及解决方案是什么?
- 11. 项目是个人的吗?上线了吗?有真实用户大规模上线吗?简历数字真实性,是线上数据还是自测?
- 12. 项目里最难的 Agent 故障是哪次?状态错乱还是工具超时?怎么定位的?
- 13. 结合项目讲一个最难定位的线上问题(如幻觉、工具误调用或延迟过高),你是怎么找到原因并修复的?
- 14. 关于 Agent 的优缺点和发展前景,你怎么看?
- 15. 你之前实习中做过的模块(如用户画像)与当前岗位职责有多大交叉?这部分具体是怎么做的?
- 16. 讲一下你之前实习的 Agent 的设计逻辑,以及创新方法是如何实现的?
- 17. 简单介绍项目后,你有哪些项目最想跟面试官分享?请展开讲讲。
- 规划与推理
-
- 1. 在 Agent 的设计中,\”规划能力\”至关重要。目前有哪些主流方法可以赋予 LLM 规划能力?(例如 CoT、ToT、GoT)
- 2. Agent 规划能力如何实现?多任务协同怎么做?
- 3. ReAct 框架的核心思想是什么?为什么它比纯 prompting 在复杂任务上表现更好?
- 4. ReAct 和 Plan-and-Execute 的取舍?长任务里你为什么选其中一个?
- 5. Agent 的任务是怎么拆分的?拆分粒度怎么确定?拆太细和拆太粗分别有什么问题?
- 6. 项目里的 Modular Agent 是如何实现多步规划的?
- 7. 如果让你设计一个能行程规划的旅行 Agent,你会如何拆解任务?各子 Agent 职责怎么划分?
- 8. 如果用户连续追问\”为什么选这家酒店?\”,Agent 如何回溯决策链并给出可解释理由?
- Prompt 工程与结构化输出
-
- 1. 你的 Agent 系统 Prompt 是怎么设计和迭代的?有没有做过 Prompt 自动优化?当用户提出不完整的请求时,如何补全用户意图?
- 2. Prompt 通常怎么组织?Few-shot、CoT 和 System Prompt 分别放在哪里?如何减少幻觉?
- 3. 如何设计有效的提示词?有哪些实用技巧?提示工程的主要方法有哪些?有哪些优化技巧?
- 4. 提示词模板是怎么设计与迭代的?如何判断一个 prompt 模板真的变好了?
- 5. Prompt 自动推荐模块用了哪些优化策略?有没有尝试过 Prompt 压缩或 embedding 表示的方式?
- 6. 你做 Prompt 优化时,是如何判断优化后的 Prompt 在 Agent 推理链路中性能提升的?用什么指标来衡量?
- 7. 除了基础约束外,还使用过哪些 Prompt 优化方法?
- 8. 如何提升模型结构化输出的稳定性和可解析性?追问:模型把数值输出成了带中文单位的字符串,怎么处理?
- 9. 数据的输入输出格式如何保证大模型输出稳定的 JSON?做了哪些工作?
- 10. 大模型输出前后不一致怎么办?如何确保大模型输出内容的一致性?
- 上下文管理
-
- 1. 上下文是如何构建的?怎么避免上下文污染或信息冲突?
- 2. 如果上下文窗口不够,你会优先保留哪些信息?有没有做过压缩?
- 3. 多轮对话上下文状态管理是如何做的?如何在高并发场景下保证一致性?
- 4. 对话超过上下文窗口后怎么压缩?摘要和向量检索应该怎么配合?
- 5. Agent 运行上下文如何管理?如何避免上下文过长导致模型效果下降?
- 6. 上下文压缩(Context Compression)技术了解多少?为什么 Agent 场景需要上下文优化?
- 7. 上下文为什么需要压缩?压缩后丢失细节如何处理?
- 8. Harness 工程里\”上下文压缩\”你们做了几层:滑窗、摘要、关键帧保留、工具结果裁剪?各自 token 节省多少?
- 9. AI Coding 场景里,让 Agent 改一个跨文件 Bug,上下文怎么裁剪?(不会把整个仓库塞进 prompt 吧)
- 10. 多轮对话里用户说\”刚才那个改成 MySQL\”,你怎么把指代消歧到前一轮的具体实体?
- 框架选型与 LangChain / LangGraph
-
- 1. 有没有用到类似 AutoGen 或 LangChain 的框架?为什么选这个框架?
- 2. 你用过哪些 Agent 框架?选型是如何选的?你最终场景的评价指标是什么?
- 3. 介绍一些 Agent 的实现框架,这些框架有什么区别?
- 4. 了解哪些 agent 开发框架,例如 LangChain 和 LlamaIndex,他们核心应用场景有何不同?
- 5. LangChain 有哪些核心组件?LCEL 和传统 Chain 相比解决了什么问题?LCEL 为什么比老 Chain 类好?
- 6. LangChain 的 Chain 和 Agent 本质区别是什么?为什么生产里不全用 Agent?
- 7. LangGraph 和 LangChain \’AgentExecutor\’ 有什么区别?复杂任务为什么更适合用 LangGraph?
- 8. LangGraph 适用于什么场景?LangGraph 构建 Agent 的方式有哪几种?
- 9. 用 LangGraph 实现多轮对话 Agent,相比手写 prompt 流程有哪些工程和效果优势?
- 10. LangChain 和 LangGraph 在你项目里分别承担什么?为什么后期要切到 LangGraph?
- 11. StateGraph 中的节点、普通边和条件分支怎么定义?Checkpointer 解决了什么问题?
- 12. LangGraph 的 State、Node、Edge 怎么设计的?reducer 怎么写?
- 13. StateGraph 里 Node / Edge / State 三件套,你们 State 是 TypedDict 还是 Pydantic?Reducer 怎么写?
- 14. LangGraph checkpoint 用 MemorySaver 还是 PostgresSaver?thread_id 怎么和用户会话绑定?
- 15. Conditional Edge 怎么避免 Agent 在\”检索-重规划\”之间死循环?最大步数和外层 timeout 谁兜底?
- 16. 中断恢复怎么做?人机确认节点落在图的哪?非幂等工具(比如真下单)怎么防重放?
- 17. 技术选型:LangGraph vs 自研 while-loop harness,什么体量下后者更合适?
- 18. 你带队或主导的 Agent 项目,技术选型时 LangChain 生态 vs 自研 Harness 你怎么拍板?
- 19. 模型选型主要关注哪些指标(效果、延迟、成本、上下文长度)?为什么选择当前模型?是否对比过其他模型?
- Harness 与 AI Coding
-
- 1. Harness 层你理解是什么?Agent loop 里状态、记忆、工具、观测四件事分别放哪?
- 2. 如何理解 Spec Coding 和 Harness?
- 3. Harness 为什么可能提升 Agent 的任务完成能力?
- 4. Codex / Claude Code 类 harness 你实战过没?fork 过 deep-agent 没?upstream 冲突怎么处理?
- 5. Codex 实战题:让 Agent 改一个 Java Spring 接口并跑通单元测试,harness 怎么隔离沙箱、怎么把编译错误喂回模型?
- 6. AI Coding Agent 跑 CI 前怎么防它把密钥写进代码提交?沙箱和权限边界怎么画?
- 7. 你是否写过 Skill?通常如何设计和评估一个 Skill?
- 8. 常用哪些 AI Coding 工具?使用 Claude Code 时有哪些习惯?
- 9. Vibe Coding 是什么?优缺点?使用 AI Coding 工具遇到的问题及解决方案?把 AI 编程流程抽象成一个 Skill。
- 10. 日常使用哪些 AI 工具?如何理解 MCP、Skill 和 CLI 的作用?
- 意图识别
-
- 1. 对话系统里的意图识别怎么做?规则、小模型和 LLM 分类分别适合什么场景,边界在哪?
- 2. 用 LLM 做意图分类时,Zero-shot 和 Few-shot 怎么选?样本很少时如何保证稳定性?
- 3. 是否做过意图识别?如果要做意图识别,可以怎么实现?
- 4. 意图识别你怎么做?规则 + 分类模型 + LLM 三套方案说下取舍,座舱场景下误触怎么办?
- 5. 你简历中的客服 Agent 项目,是如何判断用户意图是否需要调用外部 API 的?用了分类模型还是 prompt 判断?
- 6. 意图识别模块线上 badcase:用户说\”把上周报表发我\”但没说发哪、发给谁,Agent 该堵住还是反问还是默认?
- 评估、迭代与工程化
-
- 1. 如何评估 Agent 效果?任务完成率、工具选择准确率、推荐回答正确性和人工接管率分别怎么统计?
- 2. Agent 评估体系包括哪些维度?如何衡量 planning 能力和 hallucination rate?
- 3. 你们 Agent 评测集怎么建?任务完成率、工具准确率、幻觉率分别怎么量化?
- 4. 如何评估一个 Agent 系统的鲁棒性?除了准确率,还会测试哪些对抗性或边缘 case?
- 5. 项目上线后,你是如何收集 badcase 并迭代模型 / 策略的?有做在线学习吗?
- 6. Bad Case 怎么回流?如何把线上问题整理成稳定的离线回归测试集?
- 7. 意图识别模型线上漂移了怎么发现?badcase 怎么回流?用不用在线蒸馏?
- 8. 意图识别模块从 LLM 路由回退到轻量分类模型,你们怎么定阈值?误路由率多少能接受?
- 9. 模型升级(Qwen 切 GLM 切自研)时 Agent 提示词和工具 Schema 要动哪些?回归测试怎么跑?
- 10. 最近半年你学的最离谱或最有用的一项 Agent 相关技术是什么?怎么上手验证的?
- 11. 给你一个完全没接触过的框架(比如新出的 harness runtime),你一周内怎么判断能不能上生产?
- 性能、成本与安全落地
-
- 1. 如果 Agent 的 P95 延迟要求是 2 秒,但当前需要 5 秒,你会怎么从并发调用、Prompt Cache、Semantic Cache 和模型分层调度几方向优化?
- 2. 场景题:假如一个 Agent 推理链路包含 3 个工具 + 高频请求,系统整体延迟较高,你会如何优化?
- 3. 如果 Agent 推理 API 需要低延迟响应,你会从哪些方面做系统级优化?
- 4. 多 Agent 成本怎么控?token 预算超限时先砍记忆还是砍检索还是砍规划?
- 5. Token 消耗过快时,如何排查和优化?
- 6. 在线服务如何实现高并发?响应超 3 秒怎么优化?
- 7. 在真实场景中,如何防止 Agent 泄露用户隐私或越权操作?从算法和系统层面谈谈你的设计。
- 8. ToC 上线安全过滤,敏感词和违规内容怎么过滤?
- 9. 如果业务方坚持上线一个风险较高的 AI 功能,你会如何说明风险并推动灰度、人工确认或降级方案?
- 10. 业务方要 2 周上线一个 Agent demo,但 RAG 知识库没齐,你怎么排优先级和画甘特?
- AI 辅助代码单测
-
- 1. AST、调用关系这些信息是怎么用的?
- 2. 单测生成里,哪些代码不适合生成单测?你们是如何识别并过滤这些代码的?
- 3. 覆盖率很高但测试质量很差,这种情况见过吗?怎么解决?
- 4. mock 在单测里什么时候是必须的?什么时候 mock 反而会降低测试质量?
- 5. 如果一个函数同时依赖数据库和 RPC,你会怎么保证生成的单测稳定运行?你会如何设计隔离策略?
- 6. 你们如何评估单测质量?除覆盖率还有哪些指标?有没有引入 AI Review 工具?
-
认知、架构与项目表述
1. 自我介绍(建议控制在 2 分钟内,突出与大模型 / Agent 相关的经历)。
推荐回答:您好,我有3年大模型应用与AI Agent开发经验,熟悉主流大模型API、LangChain/LangGraph等Agent框架,具备从0到1落地企业级Agent项目的完整经验。过去主导过企业运维自动化Agent、多智能体内容生产系统两个核心项目,负责Agent架构设计、核心模块开发与效果优化,解决了多工具调用准确率低、长链路任务状态错乱等关键问题,将端到端任务完成率从65%提升至88%。此外我对RAG、记忆管理、工具编排、Agent评测都有完整落地经验,对Agent的技术演进和落地痛点有深入理解,希望能在贵司深耕这个方向。
2. 简单讲一个你最有代表性的项目,你在其中解决的最关键问题是什么?追问:这个项目的整体流程是怎样的?你具体负责哪一部分、怎么做决策的?遇到的最大挑战是什么、怎么解决的?
推荐回答:
- 代表性项目:企业级运维自动化Agent,面向内部运维人员,通过自然语言指令完成服务故障排查、资源查询、日志分析等工作。
- 最关键问题:解决了传统运维操作门槛高、步骤繁琐的问题,同时攻克了多工具协同下任务完成率低的核心痛点。
- 整体流程:需求调研与边界定义 → 架构设计与模块拆分 → 核心模块开发(记忆/规划/工具) → 评测数据集建设与效果优化 → 灰度上线与迭代。
- 负责部




