传统 LLM
你问一句,我答一句。它擅长理解与生成文本,却无法主动进入外部世界。
Agent 把“会说”的大模型接上感知、规划、工具与执行:它不只回答问题,也能围绕目标把事情做完。
你问一句,我答一句。它擅长理解与生成文本,却无法主动进入外部世界。
主动感知环境、拆解目标、调用工具并执行,让输出进入真实的任务流程。
类比:大脑的工作台
当前对话的上下文窗口,容量有限,例如记住用户刚刚给出的旅行时间。
类比:大脑的图书馆
历史信息向量化存入数据库,需要时按语义相似度检索,例如找回三个月前的偏好。
本质:推理范式
通过 Prompt 引导 Thought / Action / Observation;灵活,但格式可能不稳定。
{ tool, args }JSON Schema本质:技术协议
模型原生输出 JSON Schema;适合明确工具调用,效率与稳定性更高。
适合个人助手、单一领域问答、简单自动化。架构简单、上下文一致、响应较快,但复杂任务容易成为单点瓶颈。
面对需求分析、架构设计、编码、安全审计等可拆分任务,让不同专业 Agent 协同;覆盖更广,但有通信成本与更高开发成本。
感知、规划、工具调用、执行与反馈,让语言模型不止停在对话框里。
ReAct 提供多步推理节奏,Function Calling 提供结构化工具通信。
多 Agent 用分工应对复杂任务;具身场景中 Agent 是大脑与身体的连接桥梁。
一、单项选择题(每题 10 分,共 100 分)
二、实操题(每题 50 分,共 100 分)
题目描述:
请你设计一个"智能旅行规划 Agent"的完整工作流。用户输入旅行目的地和天数,Agent 需要完成以下任务:
要求:
search_weather、search_attractions、plan_itinerary、estimate_budget)参考答案:
使用平台:通义千问(Qwen)
Agent 工具定义:
| 工具名 | 功能 | 参数 |
|---|---|---|
search_weather | 查询目的地天气 | city: string, date: string |
search_attractions | 搜索景点推荐 | city: string, days: int |
plan_itinerary | 规划每日行程 | attractions: list, days: int, weather: string |
estimate_budget | 估算旅行预算 | city: string, days: int, itinerary: list |
ReAct 循环过程:
用户输入:"帮我规划一个北京 3 日游的行程" 【第 1 轮】 Thought: 用户需要北京 3 日游的规划。我首先需要知道北京这几天的天气情况,以便合理安排户外和室内活动。 Action: search_weather(city="北京", date="2024-10-15") Observation: 10月15日晴,16-22°C;10月16日多云,14-20°C;10月17日小雨,12-18°C 【第 2 轮】 Thought: 天气情况已获取。前两天天气不错,适合户外活动;第三天有小雨,建议安排室内景点。接下来搜索北京的热门景点。 Action: search_attractions(city="北京", days=3) Observation: 推荐景点包括:故宫、天安门广场、长城(八达岭)、颐和园、天坛、国家博物馆、798艺术区、南锣鼓巷、鸟巢水立方 【第 3 轮】 Thought: 景点列表已获取。现在需要根据天气和景点位置来规划每日行程。第一天天气晴朗,适合户外,安排故宫和天安门广场;第二天多云,可以去长城和颐和园;第三天有雨,安排国家博物馆和798艺术区(室内为主)。 Action: plan_itinerary(attractions=["故宫","天安门广场","长城","颐和园","国家博物馆","798艺术区"], days=3, weather="D1晴,D2多云,D3小雨") Observation: 行程规划完成: Day1(晴):上午天安门广场 → 下午故宫博物院 Day2(多云):上午八达岭长城 → 下午颐和园 Day3(小雨):上午国家博物馆 → 下午798艺术区 【第 4 轮】 Thought: 行程已规划好,现在需要估算预算。北京 3 日游需要考虑交通、住宿、门票、餐饮等费用。 Action: estimate_budget(city="北京", days=3, itinerary=["天安门广场","故宫","长城","颐和园","国家博物馆","798艺术区"]) Observation: 预估预算:交通(含往返)800元 + 住宿(2晚)600元 + 门票 350元 + 餐饮 450元 = 总计约 2200元 【第 5 轮】 Thought: 所有子任务已完成:天气已查询、景点已推荐、行程已规划、预算已估算。现在可以汇总输出最终结果。 Final Answer: 北京 3 日游规划如下: - 天气:D1晴16-22°C / D2多云14-20°C / D3小雨12-18°C - 行程:D1 天安门广场+故宫 / D2 长城+颐和园 / D3 国家博物馆+798艺术区 - 预算:约 2200 元(含交通、住宿、门票、餐饮) - 温馨提示:第三天有雨,请带好雨具,已安排室内景点为主。
评分标准(50 分):
| 评分项 | 分数 | 评分标准 |
|---|---|---|
| ReAct 循环完整性 | 20 分 | 至少 4 轮完整的 Thought→Action→Observation,每轮 5 分。缺少一轮扣 5 分。 |
| 工具定义合理性 | 10 分 | 工具名称清晰、参数定义合理、功能描述准确。每个工具 2.5 分。 |
| 流程逻辑性 | 10 分 | 各步骤之间有合理的逻辑依赖关系(如先查天气再规划行程),逻辑混乱扣 5-10 分。 |
| 平台选择 | 5 分 | 明确说明使用国内大模型平台(通义千问/文心一言/DeepSeek/Kimi 等),未说明扣 5 分。 |
| 输出完整性 | 5 分 | 最终有完整的汇总输出,格式清晰。缺少或格式混乱扣 3-5 分。 |
二、实操题(每题 50 分,共 100 分)
题目描述:
某公司需要构建一个自动化的代码审查系统。请设计一个多 Agent 协作架构,要求至少包含 3 个不同职责的 Agent。
要求:
参考答案:
使用平台:DeepSeek(主 Agent)+ 通义千问(审查 Agent)
架构设计:多 Agent 层级协作模式(Hierarchical)
┌──────────────┐ │ 调度 Agent │ (Supervisor) │ DeepSeek │ └──┬───┬───┬──┘ │ │ │ ┌──────────────┼───┼───┼──────────────┐ │ │ │ │ │ ▼ ▼ │ ▼ ▼ ┌──────────┐ ┌──────────┐ ┌──────────┐ ┌──────────┐ │ 代码风格 │ │ 安全检查 │ │ 性能分析 │ │ 文档审查 │ │ Agent │ │ Agent │ │ Agent │ │ Agent │ │ 通义千问 │ │ 通义千问 │ │ 通义千问 │ │ 通义千问 │ └──────────┘ └──────────┘ └──────────┘ └──────────┘
各 Agent 职责定义:
(1)调度 Agent(Supervisor Agent)—— DeepSeek
(2)代码风格 Agent(Code Style Agent)—— 通义千问
(3)安全检查 Agent(Security Agent)—— 通义千问
(4)性能分析 Agent(Performance Agent)—— 通义千问
(5)文档审查 Agent(Documentation Agent)—— 通义千问
协作流程:
步骤 1:用户上传代码 → 调度 Agent 接收 步骤 2:调度 Agent 将代码同时分发给 4 个审查 Agent(并行执行) 步骤 3:各审查 Agent 独立分析,生成各自的审查结果 步骤 4:调度 Agent 收集所有审查结果 步骤 5:调度 Agent 对问题去重、合并、按严重程度排序 步骤 6:调度 Agent 生成综合审查报告,输出给用户
多 Agent 相比单 Agent 的优势:
| 对比维度 | 单 Agent 方案 | 多 Agent 方案(本设计) |
|---|---|---|
| 审查覆盖面 | 一个 Agent 需同时关注风格、安全、性能、文档,容易遗漏 | 每个 Agent 专注一个领域,审查更深入 |
| 审查质量 | 审查深度受限于单个 Agent 的上下文窗口 | 每个 Agent 各自拥有完整上下文,分析更全面 |
| 容错性 | 如果 Agent 在某个领域判断失误,没有机制纠正 | 不同 Agent 可能发现同一问题的不同角度,互为补充 |
| 可扩展性 | 增加审查维度需要修改 Agent 的 prompt | 只需新增一个专门的审查 Agent |
| 并行效率 | 串行执行,等待时间长 | 4 个 Agent 并行审查,总耗时接近最慢的单个 Agent |
评分标准(50 分):
| 评分项 | 分数 | 评分标准 |
|---|---|---|
| Agent 职责定义 | 15 分 | 至少包含 3 个不同职责的 Agent,每个 Agent 职责描述清晰。少于 3 个扣 10 分,职责描述不清每个扣 5 分。 |
| 协作流程设计 | 15 分 | 流程逻辑清晰,包含完整的分发→审查→汇总→输出流程。流程不完整扣 5-10 分,逻辑混乱扣 5-10 分。 |
| 多 Agent 优势分析 | 10 分 | 至少从 3 个维度对比单 Agent 与多 Agent 的差异。少于 3 个维度扣 5 分,分析不准确扣 3-5 分。 |
| 平台选择 | 5 分 | 明确说明使用国内大模型平台。未说明扣 5 分。 |
| 整体设计质量 | 5 分 | 整体设计合理、有创新性、具备实际落地价值。 |