国内外主流大语言模型
与智能体研究报告
概述:研究背景、概念界定与方法论
2026 年的大模型行业已走过「参数军备竞赛」的狂热期,进入能力分层、场景细分、成本可控的务实阶段。本报告在梳理主流产品的同时,重点回答一个问题:在几十个模型与 Agent 中,如何为具体场景找到「最对的那一个」。
2026 年 2 月,中国大模型总调用量首次超越美国;在全球新增开源大模型中,中国厂商占比达 90.2%;全球实力榜 TOP10 中中美各占 5 家。与此同时,Agent(智能体)从演示走向日常工具——OpenAI Operator、Claude Cowork、Manus 等产品让 AI 从「回答问题」进化为「自主执行多步任务」。本报告旨在以结构化方式呈现这一格局,为技术选型与学习路径提供参考。
智能体(Agent):以 LLM 为「大脑」,叠加规划、记忆、工具调用、自主执行能力的系统,能在最少人工干预下完成「给目标→产出成果」的长链路任务(如自动写代码、填表、做调研)。
关系:LLM 是 Agent 的能力底座;Agent 是 LLM 的「行动化」形态。两者共同构成 2026 年生成式 AI 的双主轴。
本报告综合公开权威基准与厂商披露,主要来源包括:
| 基准 | 考察维度 | 说明 |
|---|---|---|
| SuperCLUE | 中文综合理解 | 国内权威中文大模型评测,含通用总榜与垂直榜 |
| LMArena / Chatbot Arena | 人类偏好综合 | 众包对战胜率(Elo),反映真实使用体感 |
| SWE-bench Verified | 真实代码修复 | 自主编程能力黄金标准,分数高度依赖 Agent 脚手架 |
| OSWorld | 计算机/桌面操作 | 369 项真实电脑任务,Agent 桌面操作核心基准 |
| GAIA | 通用 Agent 任务 | 网页导航+文档分析+多步推理,衡量端到端自主能力 |
| GPQA / AIME | 推理与数学 | 研究生级科学题 / 数学竞赛,考察硬推理上限 |
全球大模型发展格局(2026 态势)
全球大模型由中美厂商主导,形成「双极格局」。中国力量在调用量、开源占比、头部席位三个维度同时崛起,但与美国旗舰在前沿研发与生态壁垒上仍有结构性差异。
据 Arena 全球大模型实力排行(按 Agent 自主执行能力计分),TOP10 依次为:Claude Fable 5(Anthropic)、GPT-5.6 Sol(OpenAI)、Kimi K3(月之暗面)、GLM-5.2(智谱)、Grok 4.5(xAI)、Muse Spark 1.1(Meta)、Qwen3.7 Max(阿里)、Gemini 3.1 Pro Preview(Google)、DeepSeek V4 Pro(深度求索)、Hy3(腾讯)。美国厂商多为纯闭源或混合路线,中国头部厂商普遍保留部分开源模型。
结合基准得分、功能覆盖、商业化成熟度与落地适配性,当前主流模型可划分为三大梯队(综合得分区间为公开口径的代表值):
| 梯队 | 综合得分 | 代表模型 | 定位 |
|---|---|---|---|
| 第一梯队 | 90+ | Claude Opus 4.7、GPT-5.5 Sol、Gemini 3.1 Pro、GLM-5.1、Qwen3-Max | 顶级旗舰,复杂推理/Agent/长文本/高阶代码全能 |
| 第二梯队 | 80–90 | Grok 4.0、DeepSeek V4、Mistral Large 2、Kimi K2.6、文心一言 5.0 | 商用主力,工具调用与轻量化推理均衡 |
| 第三梯队 | 70–80 | Llama 3.1、Qwen3-Coder、讯飞星火、MiniMax、阶跃 Step | 垂直/入门/开源轻量,低成本与二次微调 |
国际主流大语言模型(分类介绍)
国际阵营以美国厂商为核心,呈现「闭源主导、前沿研发、生态壁垒」三大特征。以下按代表性机构逐一梳理。
- 核心能力
- 通用推理均衡,多模态与任务闭环出色;GPT-5.2 在 SWE-bench 达 80.0%、AIME 2025 满分。
- 技术特点
- 统一多模态架构,强化函数调用与 Agent 编排;衍生 Operator(CUA 计算机操作模型)。
- 典型场景
- 通用助手、企业自动化、ChatGPT Agent 长链路任务。
- 发展现状
- 迭代快(5.2 / 5.4 / 5.5 Sol 并存),API 定价分层,Plus/Pro 订阅捆绑 Agent 能力。
- 核心能力
- Agent 执行、编程、超长文本解析为业界标杆;Fable 5 在 SWE-bench Verified 达 95.0%。
- 技术特点
- 强对齐与可解释性(Constitutional AI);Computer Use 原生桌面操作;百万 token 上下文。
- 典型场景
- 代码工程、知识工作、合规敏感型自动化(Cowork + Docker 微 VM)。
- 发展现状
- Opus 4.6 在 OSWorld 独立验证 72.7%,2026-04 Cowork 正式 GA,企业治理能力强。
- 核心能力
- 科学推理与音视频多模态突出;Gemini 3.1 Pro 在 GPQA 达 94.3%、ARC-AGI-2 77.1%。
- 技术特点
- 原生多模态(文本/图像/音频/视频);超长上下文;深度绑定 Google 生态。
- 典型场景
- 科研分析、多模态创作、Project Mariner 浏览器 Agent、Deep Research。
- 发展现状
- 3.1 Pro 与 3 Flash 并行,性价比梯度清晰;通过 Vertex AI / Gemini API 分发。
- 核心能力
- Llama 系列全开源,生态最丰富;Muse Spark 1.1 进入全球 TOP10。
- 技术特点
- 开放权重便于私有化与二次训练;社区工具链完备(vLLM、Ollama 等)。
- 典型场景
- 私有化部署、端侧/边缘推理、研究与原型。
- 发展现状
- 开源阵营核心锚点,被大量企业用作自托管底座。
- 核心能力
- 数学与推理顶尖,Grok 4 在 AIME 2025 满分;深度整合 X 平台实时数据。
- 技术特点
- 强调实时性与长思维链;与社交数据闭环结合。
- 典型场景
- 实时问答、社媒分析、硬推理任务。
- 发展现状
- Grok 4 / 4.5 持续迭代,稳居第一梯队边缘。
- 核心能力
- 欧洲合规语境下的高性能代表;兼顾开源(Mistral 系列)与商用 Large 版。
- 技术特点
- 强多语言与欧系合规;模型尺寸与成本可控。
- 典型场景
- 欧盟企业本地化部署、多语言业务。
- 发展现状
- 第二梯队主力,欧洲市场首选。
- 核心能力
- 面向企业检索增强生成(RAG)与工具调用优化。
- 技术特点
- 强 citation(引用溯源)与私有数据接入;企业级安全。
- 典型场景
- 企业知识库问答、合规文档处理。
- 发展现状
- 企业市场差异化定位,常作为 RAG 后端。
- 核心能力
- Databricks DBRX(开源企业级)、AI21(企业语言)、Snowflake 等垂类。
- 技术特点
- 与数据仓库/企业 IT 栈深度耦合。
- 典型场景
- 企业数据闭环、行业专用模型。
- 发展现状
- 与云/数据厂商绑定,构成国际阵营长尾。
国内主流大语言模型(分类介绍)
国内阵营呈现「开源比例高、中文适配强、合规私有化部署成熟」三大特征,头部模型已跻身全球第一梯队。
- 核心能力
- 中文精准度与私有化部署领先;GLM-5 综合 77.8% SWE-bench、92.7% AIME、86.0% GPQA。
- 技术特点
- 开源权重(GLM-5 开放);AutoGLM 智能体能力;长链路推理。
- 典型场景
- 企业私有化、政务/金融合规、智能体编排。
- 发展现状
- GLM-5.1 综合得分 90.5,被列为国产天花板;SuperCLUE GLM-5 64.3。
- 核心能力
- 开源生态最完善,中文性价比远超海外同级;Qwen3-Max 综合 89.7。
- 技术特点
- 全尺寸矩阵(0.5B–397B);Qwen3-VL 多模态;开放权重。
- 典型场景
- 中小企商用、二次微调、端侧部署、百炼平台智能体。
- 发展现状
- Qwen3.5(397B)SWE-bench 76.4%、AIME 91.3%;Qwen3 VL 235B OSWorld 66.7%。
- 核心能力
- 推理型代表,训练/推理成本极低;V4 完成大模型与国产算力全栈适配。
- 技术特点
- MoE 架构 + 强化学习推理;开放权重;V4 Pro 综合 71.0(SuperCLUE)。
- 典型场景
- 低成本高推理、私有化、国产算力部署。
- 发展现状
- 2026-04 发布 V4,全栈国产适配;V4 Flash 68.8、V3.2-Thinking 61.9。
- 核心能力
- 语音识别与实时交互领先;豆包系调用量居国内前列。
- 技术特点
- Doubao-Seed-2.0-pro 综合 71.5(SuperCLUE);端到端语音/视觉。
- 典型场景
- C 端助手、内容创作、实时语音应用、Coze 平台底座。
- 发展现状
- 背靠字节流量与内容生态,调用规模快速扩张。
- 核心能力
- K3(2026-07)参数约 2.8 万亿,支持 100 万 token 上下文,原生多模态,综合能力全球前三。
- 技术特点
- 超长上下文与长文档处理;K2.5 开放权重(SWE-bench 76.8%)。
- 典型场景
- 长文分析、科研、法律/金融文档、多模态理解。
- 发展现状
- K3 跻身 Arena TOP3;K2.5-Thinking 64.6(SuperCLUE)。
- 核心能力
- 中文 MMLU 评测领先,情感识别强;文心 4.0/5.0 综合 67–80。
- 技术特点
- ERNIE 知识增强架构;深度绑定搜索与产业应用。
- 典型场景
- 搜索增强、政企应用、文心智能体平台。
- 发展现状
- 文心 5.0 入第二梯队;中文评测长期第一梯队。
- 核心能力
- 背靠微信/游戏生态;Hy3 preview 曾在 OpenRouter 调用量榜首。
- 技术特点
- 多模态与推理并重;Tencent HY 2.0 Think 综合 59.2(SuperCLUE)。
- 典型场景
- 社交/内容、游戏 NPC、元器智能体平台。
- 发展现状
- 加速迭代,调用量增长显著。
- 核心能力
- 语音识别/合成标杆,教育场景深厚;星火 4.0 Ultra 综合 65.8。
- 技术特点
- 讯飞语音技术栈 + 大模型;软硬一体(学习机/办公)。
- 典型场景
- 教育、办公转录、语音交互硬件。
- 发展现状
- 斯坦福 HAI 报告中国产前十常客;MiniMax(56.0)、阶跃 Step(3.5)等同梯队。
智能体(Agent)产品与平台
Agent 是以 LLM 为大脑、具备自主执行能力的系统。其成熟度取决于「规划—记忆—工具—推理—执行」五环节的闭环质量。本节先给出能力框架,再分国际与国内梳理代表产品。
- 能力
- 在 OpenAI 云浏览器中自动导航、填表、比价、下单(到结账前待确认)。
- 技术特点
- CUA 计算机操作模型;不与本机交互,安全模型保守;Pro 全量、Plus 限次。
- 现状
- GPT-5.4 在 OSWorld-Verified 自报 75.0%;WebVoyager 约 87%。
- 能力
- 截图+点击+键入+运行 shell,跨 App 工作流;Cowork 配对知识工作。
- 技术特点
- Docker 微 VM、默认只读、显式授权;百万 token 上下文;企业 RBAC/审计。
- 现状
- 2026-04 GA;Opus 4.6 OSWorld 独立验证 72.7%(业界最可信)。
- 能力
- 仅在浏览器标签内操作;Gemini Agent 配 Deep Research Max 做深度研究。
- 技术特点
- 攻击面最小;集成 Google AI Ultra / Vertex;Mariner Studio 可视化编排。
- 现状
- 面向 Google/Workspace 生态;不参加 OSWorld(超出浏览器范围)。
- 能力
- 读代码库→规划→写码→跑测试→开 PR→回应评审,端到端自主。
- 技术特点
- 云端 VS Code 会话;适合明确 AC 的后端票/依赖升级/重构。
- 现状
- 2026 年唯一「无星号」全自主编程 Agent;设计型前端与模糊票仍吃力。
- 能力
- 给目标即异步产出成果;云端 VM(root)+ 桌面桥接本机;多 Agent 编排。
- 技术特点
- Planner 分解 + 执行 Agent 并发;GAIA Level 1 约 86.5%;可自托管。
- 现状
- 2026-03 推桌面版;开源版免费、云版 $20/mo 信用制。
- 能力
- 建站、做 PPT、剪视频、深度研究、打电话;80+ 工具 + 云端计算机。
- 技术特点
- 异步自校验;面向独立开发者与营销人。
- 现状
- 与 Perplexity 等构成国际通用 Agent 长尾。
- 能力
- 可视化搭建、插件/工作流/知识库,一键发布多平台。
- 特点
- 背靠豆包;C 端流量与内容生态联动。
- 现状
- 国内最活跃的低代码 Agent 平台之一。
- 能力
- AgentBuilder 低代码 + 搜索流量分发。
- 特点
- 知识增强、中文场景深;绑定百度搜索与产业客户。
- 现状
- 政务/行业智能体落地广。
- 能力
- 百炼平台模型托管 + 智能体编排 + 工具集成。
- 特点
- 与通义/Qwen 及阿里云栈深度集成。
- 现状
- 企业 Agent 部署主流选择。
- 能力
- 智能体创建与多渠道分发(微信/QQ 等)。
- 特点
- 借力腾讯社交与混元底座。
- 现状
- 社交场景智能体快速普及。
- 能力
- 面向手机/桌面的 GUI 自主操作 Agent。
- 特点
- 与 GLM 推理能力协同;具身/端侧操作探索。
- 现状
- 国产「计算机使用」方向代表。
- 能力
- Dify(可视化)、LangChain/AutoGen(编排)、MetaGPT(多角色)、n8n(工作流)。
- 特点
- 厂商中立、可私有化;满足合规/数据驻留硬需求。
- 现状
- 国内政企自建 Agent 首选基座。
| 平台 | 基准 | 分数 | 验证方式 |
|---|---|---|---|
| GPT-5.4 / Operator | OSWorld-Verified | 75.0% | 厂商自报 |
| Claude Opus 4.6 | OSWorld | 72.7% | 独立验证 |
| Claude Sonnet 4.6 | OSWorld | 72.5% | 独立验证 |
| Qwen3 VL 235B | OSWorld | 66.7% | 独立验证(开源) |
| Manus | GAIA Level 1 | ~86.5% | 厂商披露 / 社区 |
国内外对比分析(核心章节)
本节从技术路线、中文能力、合规私有化、生态、成本、Agent 自主性六个维度做结构化对照,并给出优劣判断与选型建议。
| 维度 | 国际(以美国为主) | 国内(中国) |
|---|---|---|
| 技术路线 | 闭源旗舰主导(OpenAI/Anthropic),Meta 等保留开源权重 | 开源比例高(智谱/阿里/DeepSeek/Kimi 开放权重),形成全球开源主力 |
| 中文能力 | 通用强、中文略逊于顶级国产;本地化细节弱 | 中文精准度与本地化体验领先,评测常居前 |
| 合规与私有化 | 数据驻留/合规模型成熟,但跨境部署受限 | 政务/金融/央国企私有化与信创适配领先 |
| 生态与开发者 | 云平台+订阅+工具链壁垒高,开发者基数大 | 平台(Coze/元器/百炼)活跃,云生态追赶中 |
| 成本 | 旗舰 API 价高(高端 $10–50/M token) | 中文场景性价比突出(国产开源可自托管降本) |
| Agent 自主性 | 前沿:Operator/Cowork/Mariner/Devin/Manus 领先 | 追击中:AutoGLM、平台型 Agent 快速补齐 GUI/编排 |
国内优势 / 短板
- 优势:性价比高、中文适配强、开源开放、合规私有化成熟、调用规模跃升
- 优势:国产算力全栈适配(DeepSeek V4)降低外部依赖
- 短板:前沿架构与原生多模态略滞后于美国旗舰
- 短板:全球开发者生态与跨境合规体系仍在建设
- 短板:自主 Agent 的产品化与可靠性追赶中
国际优势 / 短板
- 优势:前沿研发领先(推理模型、Agent 自主执行、原生多模态)
- 优势:生态壁垒高、云平台与订阅体系完善
- 优势:自主 Agent 产品最成熟(OSWorld 独立验证领先)
- 短板:中文本地化弱于顶级国产、成本偏高
- 短板:跨境数据合规与地缘政治限制其在中国落地
国产头部模型与海外旗舰的综合差距已缩小至历史最低水平:GLM-5.1、Qwen3-Max 进入第一梯队,Kimi K3 跻身 Arena 全球前三,DeepSeek 以极致性价比重塑成本曲线。但在「自主 Agent 产品化成熟度」与「全球开发者生态」两项上,国际仍暂时领先。
| 场景 | 优先考虑 | 理由 |
|---|---|---|
| 中文高合规私有化(政务/金融) | 国内(GLM / 通义 / DeepSeek) | 信创适配、中文强、可自托管 |
| 极致性价比批量推理 | 国内开源(Qwen / DeepSeek) | 开放权重 + 国产算力降本 |
| 前沿 Agent 自主执行 | 国际(Claude Cowork / Operator / Devin) | 独立验证能力强、生态成熟 |
| 通用多模态创作 | 国际(Gemini / GPT)或 国内(Kimi / 豆包) | 按语言与合规取舍 |
| 低代码业务智能体 | 国内平台(Coze / 元器 / 百炼) | 本地生态、分发渠道、中文支持 |
发展现状与未来趋势(核心章节)
现状可概括为「能力分层、场景细分、成本可控」。以下七条趋势将定义 2026 之后的竞争主轴。
多模态原生融合
文本/图像/音频/视频统一建模,从「外接多模态」走向「原生多模态」,解锁实时音视频交互与跨模态创作。
推理模型与 Test-time Compute
o1 式长思维链成为标配,通过推理时算力投入换取更高准确率,硬推理(数学/科学/代码)上限持续抬升。
Agent 化(对话→自主执行)
AI 从「回答问题」进化为「交付成果」,规划-记忆-工具-执行闭环成熟,企业工作流被重构。
开源与国产算力全栈
以 DeepSeek V4 国产算力适配为标志,算法创新+算力自主+成本可控构成中国 AI 全链路崛起主线。
长上下文与端侧/边缘部署
百万 token 上下文普及,模型向手机/PC/ IoT 端侧下沉,隐私与低延迟场景爆发。
安全对齐与合规治理
权限治理、审计、数据驻留成为 Agent 落地硬门槛;对齐与可控性成为企业采购核心指标。
中美技术脱钩与自主生态
算力/模型/生态双轨并行,各自形成自主技术栈与标准体系,国产替代与出海并行推进。
结论与建议
| 角色 | 建议 |
|---|---|
| 技术决策者 | 先以消除「硬约束」(隐私/部署方式/上下文/预算)做初筛,再按任务选基准,分数差 2–3 分视为并列 |
| 企业落地 | 高合规选国产私有化;前沿 Agent 选国际成熟产品;用 Dify/LangChain 自建以保数据驻留 |
| 成本敏感 | 优先国产开源自托管(Qwen/DeepSeek/GLM),以国产算力进一步降本 |
| 风险把控 | 高 stakes 任务保留人在环;区分自报与独立验证分数,不唯排行榜 |
理解 LLM 与 Agent 是 2026 年 AI 应用的底层素养。可沿星火之光 AI 四层进阶体系系统学习:
| 层级 | 内容 | 与本研究关联 |
|---|---|---|
| L1 公益启蒙 | AI 认知、工具速成 | 建立 LLM/Agent 基本概念(见本报告 1.2) |
| L2 技能提升 | AI 办公 / AIGC / 垂直职能 | 用主流模型与平台(Coze/元器)做应用 |
| L3 认证就业 | AI 智能体应用师 / AIGC 工程师 / 训练师 | 动手搭建与运维 Agent(见本报告 5 章) |
| L4 产教融合 | 企业内训 / 数字员工共建 | 企业级选型与私有化落地(见本报告 6 章) |
附录:术语表与数据来源
| 术语 | 释义 |
|---|---|
| LLM | 大语言模型(Large Language Model),以词预测为核心的基座模型 |
| Agent | 智能体,以 LLM 为大脑、具备规划-记忆-工具-执行的自主系统 |
| RAG | 检索增强生成(Retrieval-Augmented Generation),接外部知识降低幻觉 |
| MCP | 模型上下文协议(Model Context Protocol),Agent 连接工具的标准接口 |
| 上下文窗口 | 模型单次可处理的最大 token 数,头部已达百万级 |
| 开源权重 | 模型参数公开可下载,支持自托管与二次训练 |
| Test-time Compute | 推理时投入更多算力(长思维链)以提升准确率 |
SuperCLUE(中文综合)、LMArena / Chatbot Arena(人类偏好)、SWE-bench Verified(代码)、OSWorld(桌面操作)、GAIA(通用 Agent)、GPQA / AIME(推理与数学)。行业态势数据参考公开研究报告与厂商披露(截至 2026-09)。
各模型与 Agent 的官方文档、SuperCLUE 排行榜、LMArena 排行榜、SWE-bench / OSWorld / GAIA 基准主页,以及星火之光 AI 官网(sparklight-ai.com)相关课程与 GEO 说明文档。具体网址以各机构最新发布为准。
