新闻动态

国内外主流大语言模型(LLM)与智能体(Agent)研究报告 · 2026

SPARKLIGHT AI · 研究报告

国内外主流大语言模型
与智能体研究报告

Large Language Models & Agents — China vs. Global(2026)
系统梳理中国与国际代表性 LLM 与 Agent 产品的核心能力、技术特点、典型场景、发展现状与未来趋势,并对比分析国内外差异。面向开发者、企业决策者与 AI 学习者。
数据截至 2026-09 · 星火之光 AI 整理 · 引用基准:SuperCLUE / LMArena / SWE-bench / OSWorld / GAIA · 版本 v1.0
01 — OVERVIEW

概述:研究背景、概念界定与方法论

2026 年的大模型行业已走过「参数军备竞赛」的狂热期,进入能力分层、场景细分、成本可控的务实阶段。本报告在梳理主流产品的同时,重点回答一个问题:在几十个模型与 Agent 中,如何为具体场景找到「最对的那一个」。

1.1 研究背景与目的

2026 年 2 月,中国大模型总调用量首次超越美国;在全球新增开源大模型中,中国厂商占比达 90.2%;全球实力榜 TOP10 中中美各占 5 家。与此同时,Agent(智能体)从演示走向日常工具——OpenAI Operator、Claude Cowork、Manus 等产品让 AI 从「回答问题」进化为「自主执行多步任务」。本报告旨在以结构化方式呈现这一格局,为技术选型与学习路径提供参考。

1.2 核心概念界定:LLM 与 Agent
大语言模型(LLM):基于海量文本训练、以「下一个词预测」为核心机制的基座模型(如 GPT、Claude、通义千问),擅长语言理解、生成、推理,是单轮/多轮对话的智能内核。
智能体(Agent):以 LLM 为「大脑」,叠加规划、记忆、工具调用、自主执行能力的系统,能在最少人工干预下完成「给目标→产出成果」的长链路任务(如自动写代码、填表、做调研)。
关系:LLM 是 Agent 的能力底座;Agent 是 LLM 的「行动化」形态。两者共同构成 2026 年生成式 AI 的双主轴。
1.3 方法论与数据来源

本报告综合公开权威基准与厂商披露,主要来源包括:

主要评测基准说明
基准考察维度说明
SuperCLUE中文综合理解国内权威中文大模型评测,含通用总榜与垂直榜
LMArena / Chatbot Arena人类偏好综合众包对战胜率(Elo),反映真实使用体感
SWE-bench Verified真实代码修复自主编程能力黄金标准,分数高度依赖 Agent 脚手架
OSWorld计算机/桌面操作369 项真实电脑任务,Agent 桌面操作核心基准
GAIA通用 Agent 任务网页导航+文档分析+多步推理,衡量端到端自主能力
GPQA / AIME推理与数学研究生级科学题 / 数学竞赛,考察硬推理上限
数据口径声明:2026 年模型版本号与分数在不同来源存在出入(如 GPT-5.4 / 5.5 / 5.6、Claude Fable 5 / Opus 4.7 / 4.8 等命名并存)。本报告一律标注「截至 2026-09 公开基准 / 厂商自报,仅供参考」,并区分 独立验证厂商自报 两类分数(尤其 Agent 的 OSWorld 分数),不杜撰未核实数据。
1.4 阅读导航
02 — GLOBAL LANDSCAPE

全球大模型发展格局(2026 态势)

全球大模型由中美厂商主导,形成「双极格局」。中国力量在调用量、开源占比、头部席位三个维度同时崛起,但与美国旗舰在前沿研发与生态壁垒上仍有结构性差异。

首超 美国
2026-02 中国大模型总调用量
90.2%
全球新增开源大模型中国厂商占比
5+5
全球实力 TOP10 中美各占席位
100
头部模型上下文窗口(token)量级
2.1 中美双极格局

据 Arena 全球大模型实力排行(按 Agent 自主执行能力计分),TOP10 依次为:Claude Fable 5(Anthropic)、GPT-5.6 Sol(OpenAI)、Kimi K3(月之暗面)、GLM-5.2(智谱)、Grok 4.5(xAI)、Muse Spark 1.1(Meta)、Qwen3.7 Max(阿里)、Gemini 3.1 Pro Preview(Google)、DeepSeek V4 Pro(深度求索)、Hy3(腾讯)。美国厂商多为纯闭源或混合路线,中国头部厂商普遍保留部分开源模型。

2.2 能力梯队划分(引用 SuperCLUE 口径)

结合基准得分、功能覆盖、商业化成熟度与落地适配性,当前主流模型可划分为三大梯队(综合得分区间为公开口径的代表值):

2026 大模型能力梯队(综合得分参考)
梯队综合得分代表模型定位
第一梯队90+Claude Opus 4.7、GPT-5.5 Sol、Gemini 3.1 Pro、GLM-5.1、Qwen3-Max顶级旗舰,复杂推理/Agent/长文本/高阶代码全能
第二梯队80–90Grok 4.0、DeepSeek V4、Mistral Large 2、Kimi K2.6、文心一言 5.0商用主力,工具调用与轻量化推理均衡
第三梯队70–80Llama 3.1、Qwen3-Coder、讯飞星火、MiniMax、阶跃 Step垂直/入门/开源轻量,低成本与二次微调
关键变化:国产头部模型已稳定跻身第一梯队,与海外旗舰的差距缩小至历史最低水平——选择困境从「有没有」转为「几十个里选哪个最合适」。
03 — INTERNATIONAL LLMs

国际主流大语言模型(分类介绍)

国际阵营以美国厂商为核心,呈现「闭源主导、前沿研发、生态壁垒」三大特征。以下按代表性机构逐一梳理。

GPT-5.x 系列
OpenAI · 美国
混合路线(旗舰闭源)
核心能力
通用推理均衡,多模态与任务闭环出色;GPT-5.2 在 SWE-bench 达 80.0%、AIME 2025 满分。
技术特点
统一多模态架构,强化函数调用与 Agent 编排;衍生 Operator(CUA 计算机操作模型)。
典型场景
通用助手、企业自动化、ChatGPT Agent 长链路任务。
发展现状
迭代快(5.2 / 5.4 / 5.5 Sol 并存),API 定价分层,Plus/Pro 订阅捆绑 Agent 能力。
基准:SWE-bench ~80% · AIME 2025 100% · OSWorld(自报)75.0%
Claude 系列
Anthropic · 美国
闭源 · 编程/Agent 标杆
核心能力
Agent 执行、编程、超长文本解析为业界标杆;Fable 5 在 SWE-bench Verified 达 95.0%。
技术特点
强对齐与可解释性(Constitutional AI);Computer Use 原生桌面操作;百万 token 上下文。
典型场景
代码工程、知识工作、合规敏感型自动化(Cowork + Docker 微 VM)。
发展现状
Opus 4.6 在 OSWorld 独立验证 72.7%,2026-04 Cowork 正式 GA,企业治理能力强。
基准:SWE-bench 95.0%(Fable 5)· GPQA 93.6%(Opus 4.8)· OSWorld 72.7%(独立验证)
Gemini 系列
Google DeepMind · 美国
原生多模态 · 长上下文
核心能力
科学推理与音视频多模态突出;Gemini 3.1 Pro 在 GPQA 达 94.3%、ARC-AGI-2 77.1%。
技术特点
原生多模态(文本/图像/音频/视频);超长上下文;深度绑定 Google 生态。
典型场景
科研分析、多模态创作、Project Mariner 浏览器 Agent、Deep Research。
发展现状
3.1 Pro 与 3 Flash 并行,性价比梯度清晰;通过 Vertex AI / Gemini API 分发。
基准:GPQA 94.3% · AIME 2025 100% · SWE-bench 80.6%
Llama / Muse Spark
Meta · 美国
开源权重 · 生态丰富
核心能力
Llama 系列全开源,生态最丰富;Muse Spark 1.1 进入全球 TOP10。
技术特点
开放权重便于私有化与二次训练;社区工具链完备(vLLM、Ollama 等)。
典型场景
私有化部署、端侧/边缘推理、研究与原型。
发展现状
开源阵营核心锚点,被大量企业用作自托管底座。
基准:Llama 3.1 居第三梯队 · Muse Spark 1.1 入 TOP10
Grok 系列
xAI · 美国
实时数据 · 推理强
核心能力
数学与推理顶尖,Grok 4 在 AIME 2025 满分;深度整合 X 平台实时数据。
技术特点
强调实时性与长思维链;与社交数据闭环结合。
典型场景
实时问答、社媒分析、硬推理任务。
发展现状
Grok 4 / 4.5 持续迭代,稳居第一梯队边缘。
基准:AIME 2025 100% · 综合得分 80–90 区间
Mistral Large
Mistral AI · 法国
欧洲代表 · 开源+商用
核心能力
欧洲合规语境下的高性能代表;兼顾开源(Mistral 系列)与商用 Large 版。
技术特点
强多语言与欧系合规;模型尺寸与成本可控。
典型场景
欧盟企业本地化部署、多语言业务。
发展现状
第二梯队主力,欧洲市场首选。
基准:第二梯队(80–90)· 多语言优势
Command R+
Cohere · 加拿大
企业 RAG 专精
核心能力
面向企业检索增强生成(RAG)与工具调用优化。
技术特点
强 citation(引用溯源)与私有数据接入;企业级安全。
典型场景
企业知识库问答、合规文档处理。
发展现状
企业市场差异化定位,常作为 RAG 后端。
定位:企业 RAG / 引用溯源专精
区域/开源其他代表
Databricks / AI21 等
行业/区域特色
核心能力
Databricks DBRX(开源企业级)、AI21(企业语言)、Snowflake 等垂类。
技术特点
与数据仓库/企业 IT 栈深度耦合。
典型场景
企业数据闭环、行业专用模型。
发展现状
与云/数据厂商绑定,构成国际阵营长尾。
定位:企业数据栈耦合型模型
3.1 国际阵营小结
闭源主导:OpenAI、Anthropic 旗舰闭源,Meta 等保留开源权重;前沿研发:在推理模型、Agent 自主执行、原生多模态上持续领先;生态壁垒:绑定云平台(Azure / Vertex / AWS)、开发者工具与订阅体系,形成高转换成本。
04 — CHINA LLMs

国内主流大语言模型(分类介绍)

国内阵营呈现「开源比例高、中文适配强、合规私有化部署成熟」三大特征,头部模型已跻身全球第一梯队。

智谱 GLM
智谱 AI · 清华系
国产天花板 · 开源权重
核心能力
中文精准度与私有化部署领先;GLM-5 综合 77.8% SWE-bench、92.7% AIME、86.0% GPQA。
技术特点
开源权重(GLM-5 开放);AutoGLM 智能体能力;长链路推理。
典型场景
企业私有化、政务/金融合规、智能体编排。
发展现状
GLM-5.1 综合得分 90.5,被列为国产天花板;SuperCLUE GLM-5 64.3。
基准:SWE-bench 77.8% · AIME 92.7% · GPQA 86.0%(开源)
通义千问 Qwen
阿里云 · 中国
开源生态 · 中文性价比
核心能力
开源生态最完善,中文性价比远超海外同级;Qwen3-Max 综合 89.7。
技术特点
全尺寸矩阵(0.5B–397B);Qwen3-VL 多模态;开放权重。
典型场景
中小企商用、二次微调、端侧部署、百炼平台智能体。
发展现状
Qwen3.5(397B)SWE-bench 76.4%、AIME 91.3%;Qwen3 VL 235B OSWorld 66.7%。
基准:SWE-bench 76.4% · AIME 91.3% · GPQA 88.4%(开源)
DeepSeek
深度求索 · 中国
极致性价比 · 国产算力
核心能力
推理型代表,训练/推理成本极低;V4 完成大模型与国产算力全栈适配。
技术特点
MoE 架构 + 强化学习推理;开放权重;V4 Pro 综合 71.0(SuperCLUE)。
典型场景
低成本高推理、私有化、国产算力部署。
发展现状
2026-04 发布 V4,全栈国产适配;V4 Flash 68.8、V3.2-Thinking 61.9。
基准:SuperCLUE V4 Pro 71.0 · V4 Flash 68.8
豆包 Doubao
字节跳动 · 中国
调用量大 · 多模态
核心能力
语音识别与实时交互领先;豆包系调用量居国内前列。
技术特点
Doubao-Seed-2.0-pro 综合 71.5(SuperCLUE);端到端语音/视觉。
典型场景
C 端助手、内容创作、实时语音应用、Coze 平台底座。
发展现状
背靠字节流量与内容生态,调用规模快速扩张。
基准:SuperCLUE Doubao-Seed-2.0-pro 71.5
Kimi
月之暗面 · 中国
超长上下文 · 原生多模态
核心能力
K3(2026-07)参数约 2.8 万亿,支持 100 万 token 上下文,原生多模态,综合能力全球前三。
技术特点
超长上下文与长文档处理;K2.5 开放权重(SWE-bench 76.8%)。
典型场景
长文分析、科研、法律/金融文档、多模态理解。
发展现状
K3 跻身 Arena TOP3;K2.5-Thinking 64.6(SuperCLUE)。
基准:SWE-bench 76.8%(K2.5)· Arena TOP3(K3)
文心一言
百度 · 中国
中文评测 · 产业落地
核心能力
中文 MMLU 评测领先,情感识别强;文心 4.0/5.0 综合 67–80。
技术特点
ERNIE 知识增强架构;深度绑定搜索与产业应用。
典型场景
搜索增强、政企应用、文心智能体平台。
发展现状
文心 5.0 入第二梯队;中文评测长期第一梯队。
基准:SuperCLUE 文心 4.0 67.2 · 5.0 第二梯队
混元 Hy3
腾讯 · 中国
社交/游戏 · 调用榜首
核心能力
背靠微信/游戏生态;Hy3 preview 曾在 OpenRouter 调用量榜首。
技术特点
多模态与推理并重;Tencent HY 2.0 Think 综合 59.2(SuperCLUE)。
典型场景
社交/内容、游戏 NPC、元器智能体平台。
发展现状
加速迭代,调用量增长显著。
基准:SuperCLUE Tencent HY 2.0 Think 59.2 · Hy3 入 TOP10
讯飞星火
科大讯飞 · 中国
语音核心 · 教育场景
核心能力
语音识别/合成标杆,教育场景深厚;星火 4.0 Ultra 综合 65.8。
技术特点
讯飞语音技术栈 + 大模型;软硬一体(学习机/办公)。
典型场景
教育、办公转录、语音交互硬件。
发展现状
斯坦福 HAI 报告中国产前十常客;MiniMax(56.0)、阶跃 Step(3.5)等同梯队。
基准:SuperCLUE 星火 4.0 Ultra 65.8 · MiniMax 56.0
4.1 国内阵营小结
开源比例高:智谱、阿里、DeepSeek、Kimi 等均开放权重,形成全球开源主力;中文适配强:中文评测与本地化体验对标甚至超越海外同级;合规私有化成熟:政务、金融、央国企场景的本地部署与信创适配走在前列。
05 — AGENTS

智能体(Agent)产品与平台

Agent 是以 LLM 为大脑、具备自主执行能力的系统。其成熟度取决于「规划—记忆—工具—推理—执行」五环节的闭环质量。本节先给出能力框架,再分国际与国内梳理代表产品。

5.1 Agent 核心能力框架
① 规划 目标拆解·任务编排 ② 记忆 上下文·长期知识 ③ 工具 API·浏览器·代码 ④ 推理 思考·决策·纠错 ⑤ 执行 行动·产出成果 闭环:执行结果回流记忆,进入下一轮「观察—规划—行动」循环
5.2 国际代表 Agent 产品
OpenAI Operator / ChatGPT Agent
OpenAI · 美国
云端浏览器 Agent
能力
在 OpenAI 云浏览器中自动导航、填表、比价、下单(到结账前待确认)。
技术特点
CUA 计算机操作模型;不与本机交互,安全模型保守;Pro 全量、Plus 限次。
现状
GPT-5.4 在 OSWorld-Verified 自报 75.0%;WebVoyager 约 87%。
定价:Plus $20/mo 限次 · Pro $200/mo · OSWorld 75.0%(自报)
Claude Computer Use / Cowork
Anthropic · 美国
跨应用桌面 · 治理强
能力
截图+点击+键入+运行 shell,跨 App 工作流;Cowork 配对知识工作。
技术特点
Docker 微 VM、默认只读、显式授权;百万 token 上下文;企业 RBAC/审计。
现状
2026-04 GA;Opus 4.6 OSWorld 独立验证 72.7%(业界最可信)。
定价:API 按量(Sonnet 4.6 ~$3/$15 每 M token)· OSWorld 72.7%(独立验证)
Project Mariner / Gemini Agent
Google · 美国
浏览器限定 · 生态内
能力
仅在浏览器标签内操作;Gemini Agent 配 Deep Research Max 做深度研究。
技术特点
攻击面最小;集成 Google AI Ultra / Vertex;Mariner Studio 可视化编排。
现状
面向 Google/Workspace 生态;不参加 OSWorld(超出浏览器范围)。
定价:Google AI Ultra 订阅 · 浏览器基准前沿级
Devin
Cognition · 美国
自主编程 Agent
能力
读代码库→规划→写码→跑测试→开 PR→回应评审,端到端自主。
技术特点
云端 VS Code 会话;适合明确 AC 的后端票/依赖升级/重构。
现状
2026 年唯一「无星号」全自主编程 Agent;设计型前端与模糊票仍吃力。
定价:$500/mo 起 · 适合范围明确工程票
Manus
Monica(2026 被 Meta 收购)
通用 Agent · 最强自主
能力
给目标即异步产出成果;云端 VM(root)+ 桌面桥接本机;多 Agent 编排。
技术特点
Planner 分解 + 执行 Agent 并发;GAIA Level 1 约 86.5%;可自托管。
现状
2026-03 推桌面版;开源版免费、云版 $20/mo 信用制。
定价:开源免费 / 云 $20/mo · GAIA 86.5%
Genspark Super Agent
Genspark · 美国
多工具 · 创作型
能力
建站、做 PPT、剪视频、深度研究、打电话;80+ 工具 + 云端计算机。
技术特点
异步自校验;面向独立开发者与营销人。
现状
与 Perplexity 等构成国际通用 Agent 长尾。
定位:创作/研究型通用 Agent · 信用分层
5.3 国内代表 Agent 与平台
Coze(扣子)
字节跳动 · 中国
低代码智能体平台
能力
可视化搭建、插件/工作流/知识库,一键发布多平台。
特点
背靠豆包;C 端流量与内容生态联动。
现状
国内最活跃的低代码 Agent 平台之一。
定位:大众化智能体搭建与分发
文心智能体
百度 · 中国
搜索增强 · 产业
能力
AgentBuilder 低代码 + 搜索流量分发。
特点
知识增强、中文场景深;绑定百度搜索与产业客户。
现状
政务/行业智能体落地广。
定位:搜索流量型智能体生态
百炼 / 通义智能体
阿里云 · 中国
云原生 · 企业级
能力
百炼平台模型托管 + 智能体编排 + 工具集成。
特点
与通义/Qwen 及阿里云栈深度集成。
现状
企业 Agent 部署主流选择。
定位:云原生企业 Agent 中台
元器
腾讯 · 中国
社交生态 · 多端
能力
智能体创建与多渠道分发(微信/QQ 等)。
特点
借力腾讯社交与混元底座。
现状
社交场景智能体快速普及。
定位:社交生态智能体平台
AutoGLM
智谱 AI · 中国
手机/桌面自主操作
能力
面向手机/桌面的 GUI 自主操作 Agent。
特点
与 GLM 推理能力协同;具身/端侧操作探索。
现状
国产「计算机使用」方向代表。
定位:GUI 自主操作 Agent
开发框架(Dify/LangChain 等)
开源社区 · 全球
自建 Agent 基座
能力
Dify(可视化)、LangChain/AutoGen(编排)、MetaGPT(多角色)、n8n(工作流)。
特点
厂商中立、可私有化;满足合规/数据驻留硬需求。
现状
国内政企自建 Agent 首选基座。
定位:DIY Agent 框架与编排
5.4 Agent 评测基准与分数(自报 vs 独立验证)
计算机/通用操作类 Agent 基准对照(2026)
平台基准分数验证方式
GPT-5.4 / OperatorOSWorld-Verified75.0%厂商自报
Claude Opus 4.6OSWorld72.7%独立验证
Claude Sonnet 4.6OSWorld72.5%独立验证
Qwen3 VL 235BOSWorld66.7%独立验证(开源)
ManusGAIA Level 1~86.5%厂商披露 / 社区
解读:当四款前沿系统在 OSWorld 上差距收窄到 3 个百分点内时,排行榜不再主导采购决策,分化转移到失败恢复、权限治理、数据驻留等工程维度。自报分数与独立验证分数不可直接等同。
06 — CHINA vs. GLOBAL

国内外对比分析(核心章节)

本节从技术路线、中文能力、合规私有化、生态、成本、Agent 自主性六个维度做结构化对照,并给出优劣判断与选型建议。

6.1 多维度对比大表
国内外大模型与 Agent 多维对比
维度国际(以美国为主)国内(中国)
技术路线闭源旗舰主导(OpenAI/Anthropic),Meta 等保留开源权重开源比例高(智谱/阿里/DeepSeek/Kimi 开放权重),形成全球开源主力
中文能力通用强、中文略逊于顶级国产;本地化细节弱中文精准度与本地化体验领先,评测常居前
合规与私有化数据驻留/合规模型成熟,但跨境部署受限政务/金融/央国企私有化与信创适配领先
生态与开发者云平台+订阅+工具链壁垒高,开发者基数大平台(Coze/元器/百炼)活跃,云生态追赶中
成本旗舰 API 价高(高端 $10–50/M token)中文场景性价比突出(国产开源可自托管降本)
Agent 自主性前沿:Operator/Cowork/Mariner/Devin/Manus 领先追击中:AutoGLM、平台型 Agent 快速补齐 GUI/编排
6.2 优势与短板对照

国内优势 / 短板

  • 优势:性价比高、中文适配强、开源开放、合规私有化成熟、调用规模跃升
  • 优势:国产算力全栈适配(DeepSeek V4)降低外部依赖
  • 短板:前沿架构与原生多模态略滞后于美国旗舰
  • 短板:全球开发者生态与跨境合规体系仍在建设
  • 短板:自主 Agent 的产品化与可靠性追赶中

国际优势 / 短板

  • 优势:前沿研发领先(推理模型、Agent 自主执行、原生多模态)
  • 优势:生态壁垒高、云平台与订阅体系完善
  • 优势:自主 Agent 产品最成熟(OSWorld 独立验证领先)
  • 短板:中文本地化弱于顶级国产、成本偏高
  • 短板:跨境数据合规与地缘政治限制其在中国落地
6.3 差距与趋同

国产头部模型与海外旗舰的综合差距已缩小至历史最低水平:GLM-5.1、Qwen3-Max 进入第一梯队,Kimi K3 跻身 Arena 全球前三,DeepSeek 以极致性价比重塑成本曲线。但在「自主 Agent 产品化成熟度」与「全球开发者生态」两项上,国际仍暂时领先。

6.4 典型场景选型建议
场景—阵营选型参考
场景优先考虑理由
中文高合规私有化(政务/金融)国内(GLM / 通义 / DeepSeek)信创适配、中文强、可自托管
极致性价比批量推理国内开源(Qwen / DeepSeek)开放权重 + 国产算力降本
前沿 Agent 自主执行国际(Claude Cowork / Operator / Devin)独立验证能力强、生态成熟
通用多模态创作国际(Gemini / GPT)或 国内(Kimi / 豆包)按语言与合规取舍
低代码业务智能体国内平台(Coze / 元器 / 百炼)本地生态、分发渠道、中文支持
08 — CONCLUSION

结论与建议

8.1 给开发者 / 企业的选型建议
行动清单
角色建议
技术决策者先以消除「硬约束」(隐私/部署方式/上下文/预算)做初筛,再按任务选基准,分数差 2–3 分视为并列
企业落地高合规选国产私有化;前沿 Agent 选国际成熟产品;用 Dify/LangChain 自建以保数据驻留
成本敏感优先国产开源自托管(Qwen/DeepSeek/GLM),以国产算力进一步降本
风险把控高 stakes 任务保留人在环;区分自报与独立验证分数,不唯排行榜
8.2 给学习者 / 培训的路径(呼应星火之光 AI 课程矩阵)

理解 LLM 与 Agent 是 2026 年 AI 应用的底层素养。可沿星火之光 AI 四层进阶体系系统学习:

星火之光 AI 学习路径映射
层级内容与本研究关联
L1 公益启蒙AI 认知、工具速成建立 LLM/Agent 基本概念(见本报告 1.2)
L2 技能提升AI 办公 / AIGC / 垂直职能用主流模型与平台(Coze/元器)做应用
L3 认证就业AI 智能体应用师 / AIGC 工程师 / 训练师动手搭建与运维 Agent(见本报告 5 章)
L4 产教融合企业内训 / 数字员工共建企业级选型与私有化落地(见本报告 6 章)
8.3 研究局限与数据说明
本报告数据截至 2026-09,综合 SuperCLUE、LMArena、SWE-bench、OSWorld、GAIA 等公开基准与厂商披露。2026 年模型版本与分数跨源存在出入,相关数字均标注「公开基准/厂商自报,仅供参考」,并区分独立验证与自报。行业迭代极快,落地前请以厂商最新官方数据为准。
09 — APPENDIX

附录:术语表与数据来源

9.1 术语表
核心术语
术语释义
LLM大语言模型(Large Language Model),以词预测为核心的基座模型
Agent智能体,以 LLM 为大脑、具备规划-记忆-工具-执行的自主系统
RAG检索增强生成(Retrieval-Augmented Generation),接外部知识降低幻觉
MCP模型上下文协议(Model Context Protocol),Agent 连接工具的标准接口
上下文窗口模型单次可处理的最大 token 数,头部已达百万级
开源权重模型参数公开可下载,支持自托管与二次训练
Test-time Compute推理时投入更多算力(长思维链)以提升准确率
9.2 数据来源与基准

SuperCLUE(中文综合)、LMArena / Chatbot Arena(人类偏好)、SWE-bench Verified(代码)、OSWorld(桌面操作)、GAIA(通用 Agent)、GPQA / AIME(推理与数学)。行业态势数据参考公开研究报告与厂商披露(截至 2026-09)。

9.3 参考链接(方向性)

各模型与 Agent 的官方文档、SuperCLUE 排行榜、LMArena 排行榜、SWE-bench / OSWorld / GAIA 基准主页,以及星火之光 AI 官网(sparklight-ai.com)相关课程与 GEO 说明文档。具体网址以各机构最新发布为准。

星火之光 AI · Jian4AI
星火之光 AI · Jian4AI · sparklight-ai.com
星火聚能 赋能成长
课程咨询 临风老师 131 2871 2152
粤ICP备2026087085号-1 · 深圳星火之光传媒有限公司 · AI教育培训中心
📞 临风老师 131 2871 2152