
8 月 7 日,2026 夏季 InfiniTensor训练营前沿模型方向第四课、 AI 编程与智能体方向第八课《大模型自主智能体》开讲。
前置课程《AI 模型导论与推理基础原理》搭建了人工智能与深度神经网络的零基础核心认知体系,串联了 AI 发展迭代、网络原理、训练逻辑、特殊结构及模型任务五大核心内容。
本节课从智能涌现底层逻辑切入,讲解模型智能体的核心技术框架、工具学习范式、多智能体系统及未来展望。
智能涌现与Agent的诞生背景
什么是“涌现”?
1. 自然界的启示:量变引起质变(如水分子形成雪花分形)。
2. AI 领域的涌现:随着模型规模、训练数据和计算资源提升,大模型在部分复杂任务上可能表现出超过预期的能力提升,呈现类似“涌现”的现象。

当前大模型的三大局限

为什么需要 Agent?(人类智能的类比)
1. 人类进化规律:脑容量未增,但通过“使用工具”拓展边界,通过“分工协作”实现文明跃迁。
2. AI 发展路径:
- 小模型 → 大模型(类比原始人到现代人)。
- 大模型 + 工具 = 智能体(Agent)。
- 多智能体协作 = 多智能体系统(Multi-Agent System)。
行业战略风向
- OpenAI 的战略重心:Sam Altman 强调 Agent 生态构建。
- 关键产品:OpenAI 推动 Agent 生态建设,推出 GPT Store、Assistants API 等能力,并持续发展面向 Agent 应用的开发工具。
Agent 统一框架与核心技术
Agent 典型统一框架
1. 核心驱动:Foundation Model(基座模型)。
2. 循环机制:规划 Action → 调用 ToolSet → 环境执行 → 获取反馈(Result + Human Feedback)→ Summary → 下一轮规划。

ReAct 框架
1. 核心理念:Reasoning(推理)+ Acting(行动)相结合。
2. Thought(思考):当前状态分析、思维链、下一步动作决策。
3. Action(动作):具体执行的操作。

工具学习——前沿研究方向
工具学习的发展脉络
- 搜索引擎(WebSearch)→ 电商购物(WebShop)→ 物理引擎(Mind's Eye)→ 编程解题 → 万级API调用(ToolLM)。
- 结论:大模型在部分工具调用任务中已达到甚至超过普通用户水平。
三大实现路径
| 路径 | 原理 | 特点 | 代表工作 |
|---|---|---|---|
| 模仿学习 | 记录人类操作轨迹数据,进行 SFT 微调 | 需标注数据,但数据量可控 | WebGPT, WebCPM, GUI Course |
| 教程学习 | 将 API 手册/文档作为 Prompt 输入,利用上下文学习能力 | 无需训练,即插即用 | ToolLM |
| 强化学习 | 环境中自主探索试错,根据反馈更新参数 | 高度自主,探索与利用平衡 | - |
(人类监督逐渐减少,模型自主性逐渐提高)
典型应用案例:X-Agent
1. 双循环机制:
- 外循环:Plan Agent 负责任务拆解与高级管理。
- 内循环:专注子任务的低级执行、工具调用与 Reflection。

2. 效果:在部分复杂任务(如数据分析、数学推理)中,X-Agent 相比 AutoGPT 展现出更好的任务规划和执行能力。
Agent 垂直场景应用
RepoAgent:项目级代码文档生成

- 痛点:传统 LLM 只能理解单文件,无法处理复杂依赖。
- 方案:结合 AST 语法分析树,识别对象调用关系,构建全局视角。
- 成果:生成包含功能总结、参数描述、示例的详细项目文档,在项目级代码理解、文档生成质量等指标上取得领先效果。
工作流与流程自动化:从 RPA 到 APA
1. 传统 RPA 痛点:人工拖拉拽、依赖专家、静态僵化、经验难复用。

2. APA (Agentic Process Automation):
- Agent 自动构建 Workflow + 动态决策。
- 支持 Python 风格定义流程,集成 N8N 等引擎。
- Control Agent:根据数据内容动态路由(如区分 ToB/ToC 分发渠道)。

多智能体系统(Multi-Agent Systems)
为什么要做多智能体?
1. 群体智能涌现:类比生物群聚,多个 Agent 协作可能产生超越个体的群体智能。
2. 优势互补:提高解决复杂问题的准确率与效率。
两大分类
1. 社会模拟型:无特定目标,观察社群行为涌现(如谣言传播、小镇模拟)。

2. 任务完成型:目标导向,角色分工协作(如软件开发 ChatDev)。
四大核心要素
1. 任务目标:决定协同或竞争关系。
2. 组织结构:松散独立、树形层级、中心化辐射、全连接扁平化。
3. 社会关系:合作 vs 竞争(博弈)。
4. 行为路由:流水线式、互斥式、并发式。

核心挑战
- 任务目标设计(避免冲突导致非预期竞争)。
- 交互协议(探索比自然语言更高效的结构化通信)。
- 组织结构与路由的动态优化。

前沿研究与平台实践
智能体平台:AgentVerse
1. 机制:模拟真实团队协同(专家招募 → 协作讨论 → 执行 → 评估迭代)。

2. 发现:群体决策质量 > 个体;即使 Prompt 要求协作,仍可能涌现“破坏性行为”。
高效通信协议:AutoForm
1. 创新:摒弃纯自然语言,搜索形式空间,采用结构化语言(类 XML/JSON)交互。
2. 收益:减少冗余寒暄,节省 Token,提升推断准确率与沟通效率。

软件开发协作:ChatDev

1. 角色扮演:CEO、CTO、Programmer、Reviewer、Tester。
2. 流程:设计研讨 → 编码 → Review/Test → 输出无错代码。
3. 优势:低成本、低耗时,在 GitHub 上受到广泛关注。
未来展望——Internet of Agents
1. 技术演进回顾:互联网(人与人的连接)→ 物联网(物与物的连接)。
2.未来蓝图:智能体互联网(Internet of Agents)。
- 人、设备在数字孪生世界中拥有专属 Agent。
- 探索让不同智能体之间实现协作与通信。
- 实现人机共生的新文明形态。

加入训练营
📺完整课程内容,请观看直播或查看课程回放:
InfiniTensor 官网: https://www.infinitensor.com
B站直播: InfiniTensor 官方直播间
视频号直播: InfiniTensor 视频号预约
答疑交流: 训练营官方社群⬇️

关注与交流

