AI Agent 发展历史概览

从2020年AI快速发展,到现在AI Agent智能体发展历史和未来趋势

1. AI Agent 到底指什么?

Agent本身是一个非常宽泛的范围.

AI Agent(人工智能体)一种通过使用可用工具设计工作流来自主执行任务的系统。通过大语言模型理解需求、规划目标并执行任务,具备自主理解、感知、规划、记忆和使用工具的能力,能够自动化执行完成复杂任务的系统,其核心特征为主动思考与跨工具操作能力,区别于依赖预设指令的传统人工智能系统。

Agent概念并不是当今的产物,而是伴随人工智能而出现的智能实体化概念不断进化的结果

当AI工具具备以下特征时,就可以将该工具视为AI Agent

  • 自治(Autonomy): AI 智能体能够独立执行任务,无需人工干预或输入
  • 知觉(Perception): 智能体功能通过各种传感器(如摄像头或麦克风)感知和解释他们所处的环境
  • 反应(Reactivity): AI 智能体可以评估环境并作出相应的响应以实现目标
  • 推理和决策(Reasoning and decision-making): AI智能体是工具,能够分析数据并做出决策以实现目标,使用推理技术和算法来处理信息并采取适当的行动
  • 学习(learning):可以通过机器、深度和强化学习元素和技术来学习和提高他们的表现
  • 通信(Communication):AI 智能体可以使用不同的方法与其他智能体或人类进行通讯,例如理解和响应自然语言,识别语言以及通过文本交换信息
  • 目标性:实现特定的目标

1.1 AI Agent与大模型的区别

从被动响应到主动行动

大语言模型(LLM)飞速发展,如一开始ChatGPT,GPT-5,到现在的Claude,国内的Kimi3.8,GLM5.3等,已经展现出惊人的语言理解和生成能力,但它们 与Agent之间存在本质区别。首先要明确这一区别,才不会把大语言模型和Agent混淆

大语言模型可以理解为一种被动的响应系统,像一个百科全书一样:它需要用户输入提示(Prompt),然后基于这些提示生成回应,当提示不完整或者不清晰的时候,大模型的回应质量会明显下降,通常需要多轮交互才能得到满意结果。更重要的是,大模型本身无法主动获取外部信息或执行操作

可以理解为大模型本身没有手脚,没有获取外部资料的能力

Agent则是一种主动行动的系统:它只需用户提供目标,就能自主规划和执行达成目标的步骤。Agent会根据任务需求,自主思考、拆解问题、调用工具、获取信息,并最终完成任务

工具使用能力的提升

大模型虽然可以通过特定的提示工程(Prompt Engineering)来”使用工具”,但这种能力是 有限的,且需要精心设计的提示模板。大模型本身并不理解工具的实际功能和使用方法,它只是按照提示中的格式生成看似合理的输出

Agent则将工具使用能力作为其核心特性之一

  • 理解各种工具的功能和适用场景
  • 根据任务需求选择合适的工具
  • 正确构造工具调用参数
  • 解析工具返回结果并据此调整后续行动

1.2 Agent、Harness 与模型的关系

2025 年之后,社区逐渐形成一个更精确的说法:用户直接使用的其实不是”Agent”,而是”Harness(运行时/骨架)“

层级 是什么 类比 例子
模型 (LLM) 无状态、按轮次生成文本的大脑,本身不是 Agent 大脑 Claude, GPT, GLM, Qwen, Kimi
Harness 把模型变成 Agent 的软件层:运行循环、工具执行、上下文管理、权限沙箱、会话持久化、CLI/IDE 界面 手脚 + 骨架 Claude Code, Codex CLI, OpenCode, Gemini CLI, Cline, pi
Agent 模型装进 Harness 后涌现出来的行为能力 活的人

关键认知是:Agent 不是一件产品,而是”模型 + Harness + 工具”组合后涌现的能力。1.1 节说大模型”没有手脚”,Harness 就是补上的那双手脚

这也解释了为什么 Claude Code 可以在 settings.json 里更换 GLM、Qwen、Kimi 等模型:Harness 只认 Anthropic 兼容协议,端点背后接的是哪家模型,Harness 并不关心。模型与 Harness 的分离,是 2026 年 Coding Agent 普遍的架构前提

主流产品因此可以排成一条光谱,越往左自由度越高但越需要自己动手,越往右开箱即用但平台绑定越深

pi / Agent SDK  →  OpenCode  →  Claude Code  →  Codex / Copilot
极简可魔改          开源全功能      Agent-first 商业     平台化托管

第 2 章对比的各种”Coding Agent”,本质上比的都是 Harness 设计,而不是模型本身

1.3 AI Agent该如何分类?

AI Agent(人工智能智能体)的分类并没有绝对统一的标准,有各种分类方式

  • 按照技术实现路径分类的
  • 按照能力层级和功能定位分类的
  • 按照认知与智能程度分类的
  • 按照产品使用功能分类

这里把主流的Agent按照工作领域进行分类,方便理解和接受,主要分类三类:Coding Agent,Computer Agent和Research Agent,这些都不是严格分类的,而是为了能快速理解并选择自己快速上手的agent而作区分的

agent fenlei

  1. Coding Agent

Coding Agent有个更准确的名字叫Software Engineering Agent(软件工程智能体),Coding Agent只是更宽泛的叫法,如CodeX, Claude Code, OpenCode, Cursor,CodeBuddy, Cline, Qoder等

  1. Computer Agent

这类Agent就如分类名称一样,是用来操作电脑及电脑文件的agent,更适合做个人办公助手,如openclaw, workbuddy

  1. Research Agent

将 Research Agent(科研智能体)单独划分为一类,主要是因为它在任务复杂度、工作流闭环以及垂直领域的专业性上,与普通的对话型或简单工具型 Agent 有着本质的区别,如GPT Researcher, Consensus等

  1. 自我进化型通用Agent

Agent Hermes更高的定位是自主执行任务, 跨会话记忆,自动形成skills,根据过去经验持续改进

重要

2025–2026 的真实趋势是边界正在塌缩:Claude Code 能操作浏览器和文件系统,Codex 能跑云端任务,Coding Agent 正在吃掉 Computer Agent 和 Research Agent 的领地, 分类是理解起点,不是产品边界

2. 主流 Agent 对比

地区 Coding Agent 公司/团队 核心定位 CLI IDE Desktop Web / Cloud 模型
🇺🇸 海外 Claude Code Anthropic Agent-first Coding Agent Claude
🇺🇸 海外 Codex OpenAI Coding Agent / Agent Platform GPT / Codex
🇺🇸 海外 Cursor Anysphere AI IDE / Coding Agent ✅ 核心 部分 多模型
🇺🇸 海外 OpenCode Open-source Open-source Coding Agent 多模型
🇺🇸 海外 GitHub Copilot GitHub / Microsoft AI Coding Platform / Coding Agent ✅ 核心 多模型
🇨🇳 国内 Trae 字节跳动 AI IDE / Coding Agent 部分 ✅ 核心 豆包 / 多模型
🇨🇳 国内 Qoder 阿里巴巴 Agentic Coding / IDE ✅ 核心 Qwen / 多模型
🇨🇳 国内 CodeBuddy 腾讯 AI Coding Agent / IDE 混元 / 多模型
🇨🇳 国内 通义灵码 阿里巴巴 AI Coding Assistant / Agent ✅ 核心 Qwen
🇨🇳 国内 Kimi Code 月之暗面 Agent-first Coding Agent Kimi

Claude Code、Cursor、Codex, OpenCode 和 GitHub Copilot,是因为这五个agent基本覆盖了当前 AI Coding Agent 最具代表性的几条发展路线:

  • Claude Code 代表 Agent-first 的终端/开发工作流,
  • Cursor 代表 AI IDE,Codex 代表从 Coding Agent 向多端、云端自主执行发展的路线
  • OpenCode 则代表开源、模型无关的 Coding Agent
  • GitHub Copilot 最准确的定位: AI Coding Assistant / AI Coding Platform,并逐渐向 Coding Agent 演进。

相比之下,Windsurf、Cline、Kiro、Roo Code、Aider 等产品虽然各有特色,也具有一定的用户基础和技术影响力,但在产品定位上与上述路线存在较多重叠。

2.1 时间线发展历程

Agent 如果按照出现时间 + 产品形态演进来看,其实能非常清楚地看到 AI Coding 从 代码补全 → AI IDE → Coding Agent → Autonomous Coding / Agent Platform 的发展过程

“产品首次出现时间”和“现在的 Agent 形态”不是一回事。例如 GitHub Copilot 很早,但早期并不是现在意义上的 Coding Agent;Claude Code 则是从一开始就更偏 Agent-first

时间阶段 Agent 公司 当时主要形态 后来的演进
2021 GitHub Copilot GitHub / Microsoft AI 代码补全 → Chat → Agent → Coding Agent
2023 通义灵码 阿里巴巴 AI Coding Assistant → Agent / Coding Agent
2024 Cursor Anysphere AI IDE → Agentic IDE / Coding Agent
2024 Cline(非主表) Open-source IDE Coding Agent → CLI / Computer Use / Agent
2025 Claude Code Anthropic Agent-first Coding Agent → CLI → IDE → Desktop → Cloud
2025 Codex OpenAI Coding Agent → CLI → IDE → Desktop → Cloud
2025 Trae 字节跳动 AI IDE → Agentic IDE
2025 Qoder 阿里巴巴 Agentic Coding → IDE / CLI / Cloud
2025 OpenCode Open-source Open-source Coding Agent → CLI → IDE → Desktop
2025 Agent Harness(概念) 社区共识 模型与运行时分层 → Harness 成为独立产品层
2025 pi(非主表) badlogic / 开源 Minimal Agent Harness → 极简可魔改 harness 路线
2025/26 CodeBuddy 腾讯 AI Coding Assistant / Agent → CLI / IDE / Desktop / Cloud
2026 Kimi Code 月之暗面 Agent-first Coding Agent → CLI / IDE / Cloud
  • 2021:GitHub Copilot 最早出现,当时主要功能是 AI 代码补全,后来逐步演进为 AI Coding Assistant / AI Coding Platform,并逐渐向 Coding Agent 演进。
  • 2023:通义灵码最早出现,当时主要功能是 AI Coding Assistant,后来逐步演进为 Agent / Coding Agent。
  • 2024:Cursor 最早出现,当时主要形态是 AI IDE,后来逐步演进为 Agentic IDE / Coding Agent。
  • 2025:Claude Code 和 Codex 最早出现,当时主要形态是 Agent-first Coding Agent,后来逐步演进为 CLI → IDE → Desktop → Cloud
  • 2025——OpenCode:开源 Agent Harness
  • 2025——Agent Harness 概念主流化:模型可替换、Harness 才是产品本体,逐渐成为社区共识
  • 2025——pi:极简、可魔改的 Agent Harness 出现,代表光谱上”自由度最高”的一端
  • 2025年国内开始进入Agentic Coding, Trae ≈ 国内 AI IDE / Agentic Coding 路线代表
  • 2026年国内开始进入Agent Platform, CodeBuddy ≈ 国内 Agent Platform 路线代表
  • 2026年 Kimi Code出现

2.2 不同Agent优劣势

比较之前先明确一点:模型基本都能换(见1.2),所以真正值得比较的是 Harness。不同产品的优劣势,本质上是它在”自由度 ↔︎ 开箱即用”光谱上所选位置带来的取舍

决策维度 光谱一端 光谱另一端 带来的取舍
模型策略 Anthropic 兼容协议(默认Claude,可接GLM/Qwen/Kimi) 原生多 provider Harness 深度优化 vs 完全自由选择
产品形态 CLI-first IDE-first 自动化深度 vs 上手门槛低
执行位置 本地/沙箱 云端异步 数据可控 vs 并行规模化
开放程度 开源自建 商业平台 隐私可定制 vs 开箱即用
模型来源 单一模型 多模型可选 体验一致 vs 按需切换

Agent-first Harness:Claude Code、Kimi Code

Claude Code 优势

  • Agent-first 设计,长任务、跨文件重构、多步骤自主执行是强项
  • 终端工作流贴合真实工程环境(git、测试、构建、部署)
  • 扩展生态成熟:MCP、skills、subagents、hooks、Agent Teams
  • 模型层比想象中灵活:默认跑 Claude 可随时切换,通过 settings.json 配置 Anthropic 兼容端点后,可接 GLM、Qwen、Kimi 等国产模型(见 Claude Code + GLM 配置Claude Code + Qwen 配置
  • CLI → IDE → Desktop → Cloud 全形态,路线最完整

Claude Code 劣势

  • 接第三方模型依赖端点的兼容层质量,非 Claude 模型未必能跑出原生体验
  • 官方订阅、Cloud 能力与 Anthropic 账号生态绑定
  • 终端形态对非开发者仍有门槛
  • 重度使用(尤其官方模型)成本需要核算

Kimi Code 走的是类似的 Agent-first 路线,复用月之暗面的长上下文积累,模型性价比较高;但产品较新,扩展生态和第三方集成仍在建设中

最适合:专业开发者、大型/遗留代码库维护、想要”一个 harness 换着模型用”的用户

多端云端平台:Codex、CodeBuddy

Codex 优势

  • CLI / IDE / Desktop / Cloud 多端同步,云端可并行派发多个任务
  • “把任务丢出去、回头验收”的异步工作流,适合任务批处理
  • 与 OpenAI 模型及平台生态联动

Codex 劣势

  • 闭源单生态,换模型空间不如 OpenCode 这类原生多 provider 产品
  • 云端执行涉及代码出域与沙箱权限,企业需做数据合规评估
  • Harness 深度定制空间相对有限

CodeBuddy 覆盖 CLI / IDE / Desktop / Cloud 全形态,接混元和多模型,与腾讯云生态协同好,国内可用性强;但形态较新、演进快,深度绑定腾讯生态

最适合:想把重复性任务并行外包给云端的团队、腾讯云/国内企业用户

AI IDE:Cursor、Trae、Qoder、通义灵码

Cursor 优势

  • AI IDE 体验最成熟,Tab 补全 + Chat + Agent 三层能力齐备
  • 可视化 diff、按块接受修改,上手门槛低
  • 多模型可选

Cursor 劣势

  • 代码库理解依赖索引,超大仓库效果会打折
  • 长链路自主执行、复杂终端操作等深度任务弱于 CLI-first 产品
  • 订阅制,重度 Agent 用量下成本需要算账

Trae(字节):国内可用性和价格友好,豆包/多模型,AI IDE 上手快;复杂英文项目和海外生态相对弱,形态仍在演进。Qoder(阿里):Agentic Coding 与 IDE 结合紧密,Qwen 系模型协同;产品较新,生态建设中。通义灵码:VS Code / JetBrains 插件形态成熟,免费门槛低,企业渗透好;但 Assistant 基因更重,深度自主任务相对弱,无 Desktop 形态

最适合:IDE 重度用户、中小项目快速迭代、国内环境优先的用户

开源模型无关:OpenCode

优势

  • 开源、模型无关:可接本地模型或任意 API,数据不出内网
  • 可定制程度最高,适合企业内网部署和二次开发
  • 社区迭代快,新模型/新能力跟进积极

劣势

  • 没有官方商业支持,配置和维护成本转嫁给使用者
  • 体验上限取决于所接模型,换模型就是换体验
  • 稳定性、文档、跨版本兼容靠社区保障

最适合:重视隐私和成本控制的企业、有定制能力的团队、想研究 Agent 内部机制的人

平台生态:GitHub Copilot

优势

  • 与 GitHub 生态深度集成:Issue → PR → Code Review → Actions 闭环
  • 企业采购、安全审计链路成熟,组织级落地阻力小
  • 多模型 + 平台能力,适合统一管理

劣势

  • Agent 能力是后来演进而来,深度自主任务弱于 Agent-first 产品
  • 与 GitHub/Microsoft 平台绑定较深,跨生态灵活性受限
  • 产品形态仍在快速变动

最适合:已深度使用 GitHub 生态的团队、需要组织级统一采购和管理的企业

极简 Harness:pi(非主表)

优势

  • 核心极小:只保留 agent loop + 基础工具 + 会话管理,一切可 inspect、可 hack
  • 模型完全自选,provider 无关
  • 是理解”Agent 到底怎么转”的最佳学习材料

劣势

  • 需要自己动手,没有商业支持
  • 生产使用需自行补齐权限、沙箱、协作等工程化能力

最适合:学习研究、DIY 定制、二次开发自己的 Agent

选型速查

你是谁 推荐
国内新手 / 学生 / 不想花钱 Trae(永久免费,开箱即用)
日常业务开发 / 团队协作 Codex 或 通义灵码
大型项目 / 跨模块重构 Claude Code
不想被任何厂商锁定 OpenCode
高阶开发者,追求极致可控 Pi Agent
政企内网 / 国产化替代 / 私有化 文心快码 或 CodeBuddy
前端快速原型 / Figma 转代码 CodeBuddy Craft
长文本需求 / 国产终端 Agent Kimi Code
想构建自己的 Agent 产品 DeepSeek Harness
纯编码、预算有限、想用国产模型 Qwen Code(通义灵码)

产品形态变化很快,本节比较基于写作时的产品状态,选择时以各家最新文档为准

维度 Claude Code Codex OpenCode Pi Agent Trae Kimi Code CodeBuddy 文心快码
开发方 Anthropic OpenAI 社区开源 Mario Zechner 字节跳动 月之暗面 腾讯 百度
定位 旗舰终端 Agent 云端异步 Agent 开源终端 Agent 极简终端 Harness AI IDE + Agent 终端 Agent AI IDE + Agent 工程化 IDE 插件
底层模型 Claude Opus/Sonnet 系列 GPT-5.5 / GPT-5-Codex 75+ 提供商可切换 15+ 提供商可切换 豆包 Seed + 可接入第三方 K2.7 Code / K3 混元 + DeepSeek 文心大模型
模型锁定 强绑定 Claude 默认 OpenAI,可切换 完全自由 完全自由 默认豆包,会员可用第三方 绑定 Kimi 系列 混元+DeepSeek 双模型 绑定文心
运行方式 本地终端 + IDE 插件 云端沙箱 + 桌面 App 终端 TUI + 桌面 + IDE 终端 TUI AI IDE(独立应用) CLI + VS Code 插件 + Web IDE 插件 + Craft 模式 IDE 插件
技术栈 TypeScript Rust(96.2%) Go(Bubble Tea) TypeScript(自研栈)
核心工具数 18+ 内置 少量核心 大量(派生自 CC) 仅 4 个(read/write/edit/bash) 内置 SOLO Agent 终端原生 多智能体矩阵(Zulu/Plan/Architect) Multi-Agent(Zulu/Plan/Architect)
中文适配 一般 一般 取决于所选模型 取决于所选模型 ⭐ 极佳(9.8/10) ⭐ 优秀 ⭐ 优秀 ⭐ 优秀
国内可用性 ❌ 需翻墙+海外支付 ❌ 需翻墙+海外支付 ✅ 无障碍 ✅ 无障碍 ✅ 原生支持 ✅ 原生支持 ✅ 原生支持 ✅ 原生支持
开源 闭源 闭源(CLI 部分开源) ✅ 开源 ✅ MIT 闭源 部分开源 闭源 闭源
MCP 支持 核心不内置
工作模式 人机深度交互 云端异步并行 Plan/Build 双模式 极简追加式 SOLO 自动开发 终端对话驱动 SPEC 规范驱动 SPEC 规范驱动(SDD)
价格 Pro $20/月起 $8-20/月 免费,自付模型费 免费,自付模型费 个人永久免费 订阅制(曾暂停个人订阅) 有免费档,Pro $9.95/月 个人完全免费
最佳场景 复杂重构、大型项目 批量任务、并行开发 不想被锁定、自由选模型 高阶开发者、极致可控 国内新手、中文项目、零基础 长文本项目、国产终端 Agent 前端/全栈快速原型、Figma 转码 企业级、安全合规、政企

2.3 主流 Computer Agent:OpenClaw、WorkBuddy

1.3 节提到的 Computer Agent,主战场不是代码仓库,而是你的整台电脑和消息渠道:操作文件、驱动浏览器、收发消息、处理日程。用 1.2 的视角看,它们其实是另一种 Harness——把 Agent Loop 的工具集从”读写代码、跑命令”扩展成了”操作电脑”

OpenClaw:自托管路线

OpenClaw 是一个开源、自托管的 AI 网关,把聊天应用(Telegram、Discord、WhatsApp、iMessage、飞书等)连接到 pi 等 AI 代理,让助手常驻在你的消息渠道里。项目经历了一次品牌演变:Clawd → OpenClaw

核心架构:Gateway-Node-Canvas 三层

角色 说明
Gateway 控制平面(神经中枢) Node.js v22+ 长驻守护进程,所有外部通信与内部逻辑的总线;默认只绑定 127.0.0.1:18789,外部访问必须走 SSH / Tailscale 等安全隧道
Nodes 感知触手 多设备接入与远程触达的入口
Canvas 交互界面 面向用户的操作与展示层

另有一套跨平台记忆系统:多 Agent 按工作区与会话隔离,支持长期记忆同步

优势

  • 开源、本地优先:数据、密钥、Gateway 全部在自己手里,自带设备(BYOD)模式
  • 多渠道统一入口:一次配置,Telegram / Discord / 飞书等多平台共用同一个助手
  • 多智能体:可创建多个专职 Agent(如 coder),工作区与会话互相隔离
  • 技能生态:ClawHub 第三方 Skills、浏览器自动化、本地文件操作、定时任务
  • 模型无关:可接通义千问/百炼、Qwen Code、本地模型

劣势

  • 自托管有门槛:Node.js 环境、进程守护、安全隧道都要自己运维
  • 消息渠道配置繁琐:Discord / 飞书的后台建应用、事件回调设置步骤多
  • 安全责任自负:Agent 能碰本地文件和浏览器,权限边界必须自己管好
  • 无商业支持,排障依赖文档和社区

最适合:想要私有部署、数据不出本地、把 AI 常驻进聊天工具的个人开发者和极客团队

安装与架构详见 OpenClaw 安装指南使用与原理解析,模型接入见 OpenClaw + Qwen,飞书接入见 OpenClaw + 飞书

WorkBuddy:开箱即用路线

WorkBuddy 走的是与 OpenClaw 相反的一端:面向个人办公的成品 Computer Agent,主打文档、表格、邮件、日程等日常办公任务的自然语言自动化,用户不需要关心部署和模型配置

优势:上手门槛低,开箱即用;贴合办公场景,任务模板化;有官方维护和商业化支持

劣势:数据和运行都在平台侧,可控性不如自托管;深度定制空间有限;与具体办公套件生态绑定较深,跨平台能力受限(具体功能以官方最新说明为准)

最适合:不想折腾部署、只需要把日常办公琐事自动化的普通用户

两条路线怎么选

维度 OpenClaw WorkBuddy
部署方式 自托管(VPS/本地) 开箱即用 SaaS
数据归属 完全在自己手里 平台托管
接入渠道 消息应用多渠道 办公套件场景
定制能力 Skills/多 Agent 深度可定制 相对有限
使用门槛 需要运维能力
适合人群 开发者/极客/隐私敏感用户 普通办公用户

正如 1.3 节的提醒:Computer Agent 与 Coding Agent 的边界正在融合——Claude Code 能操作浏览器和文件系统,OpenClaw 也能接 pi 跑编码任务。分类型是理解起点,不是产品边界