一、导语
2026 年 6 月 29 日,Elon Musk 通过 X 平台透露,xAI 基于 1.5T 参数的 V9 基础模型训练的 Grok 4.5 正在 SpaceX 和 Tesla 内部进行私测,性能已接近 Anthropic 的 Claude Opus。这是 Grok 系列自发布以来最大的一次架构升级——不仅参数量从 Grok-3 的 314B MoE 跃升至 1.5T,还在训练策略上做出了开创性尝试:将 Cursor IDE 中的真实代码编辑交互数据纳入补充训练。
这一消息恰逢开源 AI 生态的多点爆发。Cohere 同日在 Apache 2.0 许可证下开源了其旗舰模型 Command A+(218B 参数 MoE),NVIDIA 发布了 Nemotron-3-Ultra-550B-A55B(采用 LatentMoE 架构)。三大重量级消息在同一天出现,或将重新定义 2026 年下半年 AI 行业的竞争格局。
二、背景分析:Grok 4.5 为何如此特殊?
Grok 系列从诞生之初就带有一个明确的定位:实时数据驱动的 AI 助手。Grok-1 开源发布、Grok-2 引入图形识别、Grok-3 实现多模态突破——但现在 Grok 4.5 的野心显然不止于「聊天」。
1.5T V9:参数规模的质变
1.5 万亿参数的 V9 基础模型使 Grok 4.5 成为目前公开已知参数规模最大的模型之一。作为对比,DeepSeek-V4 使用 MoE 架构约 1T 参数,GPT-5.5 约为 800B(MoE),而 Claude Opus 的具体参数量虽未公开但业界估算在数 T 级别。Grok 4.5 选择在参数量上直接对标顶级模型,说明 xAI 的 Colossus 超级计算机(由 15 万张 GPU 构成)已经具备了训练超大规模模型的基础设施能力。
参数量并不是一切——但 1.5T 意味着模型容量理论上足以存储更复杂的知识结构和推理路径。对于一个需要处理火箭推进物理、自动驾驶感知和工厂自动化等高精度任务的模型来说,容量至关重要。
Cursor 数据训练:一个行业首创
Grok 4.5 最引人注目的技术创新是补充训练数据来自 Cursor——目前最流行的 AI 代码编辑器之一。Cursor 每月处理数百万次代码补全和修改请求,核心优势在于这些数据不仅包含代码的最终状态,更包含了开发者的编辑决策过程:他们如何提出修改建议、接受或拒绝 AI 建议、手动调整哪些部分、在哪些环节选择重写。
这种「过程性数据」在 AI 训练中几乎是空白的。传统上,代码模型训练依赖 GitHub 等公开代码仓库的静态数据——只见结果,不见决策。Cursor 的数据则记录了完整的「编程思维链」,相当于从 100 万名开发者的实际编码实践中学习如何做出编程决策。
「将 Cursor 交互数据纳入训练意味着 Grok 4.5 学习的不只是代码的静态语法,而是编程决策的动态过程——这可能是它性能接近 Opus 的关键原因之一。」
三、核心内容:Grok 4.5 的关键技术细节
性能基准测试表现
Elon Musk 在 X 平台上表示 Grok 4.5 的性能「接近 Opus」。虽然未公布具体的基准测试分数,但结合 SpaceX 和 Tesla 内部的实测反馈,Grok 4.5 在以下领域表现突出:
- 技术推理——在 Rocket Propulsion 领域的工程计算和物理建模上表现优异,能够完成复杂的多步推理
- 代码生成——受益于 Cursor 数据的补充训练,在代码补全、重构和调试任务上表现接近顶级编码模型
- 多模态理解——继承了 Grok-3 的多模态能力,并在视觉-语言任务上有小幅提升
与竞品的关键对比
| 模型 | 基础参数 | 训练数据特色 | 企业部署 | 定价(输出/1M tokens) |
|---|---|---|---|---|
| Grok 4.5 | 1.5T V9 | X 平台实时数据 + Cursor 代码交互 | SpaceX/Tesla 内测 | 未公布 |
| Claude Opus | 未公开(数十 T) | 合规模数据 + RLHF/RLAIF | Anthropic API | $15 |
| GPT-5.6 Sol | 未公开 | 70万 GPU 小时安全训练 | 受控预览(政府审批) | $30 |
| Command A+ | 218B-A25B MoE | 多语言 + 多模态 + 智能体 | Cohere API / Apache 2.0 开源 | 开源免费 |
SpaceX 和 Tesla 的真实部署场景
与 OpenAI GPT-5.6 因政府安全审查而采取「逐客户审批」的谨慎发布策略不同,Grok 4.5 选择了一条完全相反的路径:在外部监管尚未明确的窗口期快速部署到真实工业场景。SpaceX 和 Tesla 超过 15 万名员工中的工程师团队正在使用 Grok 4.5 辅助以下工作:
- 火箭设计和推进系统计算——涉及复杂的流体力学、结构工程和轨道计算
- 自动驾驶训练——辅助分析驾驶场景数据、生成训练场景和验证安全策略
- 工厂自动化——优化生产线排程、设备故障预测和维护调度
- 供应链和项目管理——处理复杂的全球供应链数据和项目进度跟踪
这种「内测即实战」的策略意味着 Grok 4.5 不只是在实验室中优化基准分数,而是在真实的商业约束下验证模型的可靠性。
四、各方反应:开源生态的同步响应
Grok 4.5 的消息在同一天引发了 AI 行业的连锁反应。最值得关注的是来自开源阵营的两个重量级发布:
Cohere Command A+——在 Apache 2.0 许可证下开源了其旗舰模型 Command A+(05-2026-bf16)。这是一款 218B-A25B 的 MoE 模型,具备多模态、多语言和智能体能力。Cohere 的 CEO Aidan Gomez 在社交平台上强调:「开源不再是低端代名词。」Command A+ 的发布意味着开源模型正式进入了「旗舰级」时代——此前的开源模型大多聚焦于 7B-70B 的轻量级范围,而 218B 参数的 MoE 架构在推理时实际激活仅 25B 参数,兼顾了性能和效率。
NVIDIA Nemotron-3-Ultra-550B——采用 LatentMoE 架构的 550B-A55B 模型,改用更开放的 OpenMDW 许可证。这意味着企业可以在商用场景中更灵活地使用和定制这个模型。
行业分析师 Nathan Lambert 在当天的分析文章《Artifacts 22》中指出,开源模型生态正在经历一次结构性扩张:参与者从少数中国公司扩展到全球各类组织,包括主权 AI 玩家(Cohere、Mistral)、产品公司(JetBrains、Zed、Krea、Photoroom)和硬件厂商(NVIDIA)。这种「长尾化」趋势意味着 AI 模型的竞争正在从「几个巨头的性能竞赛」转变为「生态系统的多样性竞争」。
「Grok 4.5 在工业内测中接近 Opus 的消息与 Cohere/NVIDIA 同日发布旗舰开源模型——这两件事放在一起看,传达的是同一个信息:2026 年下半年的 AI 竞争,不再是谁有最好的模型,而是谁有最好的数据和部署生态。」
五、深度解读:Grok 4.5 的三重意义
数据主权正在成为核心竞争壁垒
Grok 4.5 使用 Cursor 交互数据和 X 平台实时数据的策略揭示了一个正在成型的竞争逻辑:最好的数据不再来自公开的互联网爬取,而是来自用户与 AI 互动的第一手交互。谁掌握更多高质量的交互数据(代码 IDE 反馈、社交媒体对话、企业内部使用日志),谁就掌握了下一代模型训练的核心燃料。
这对于 xAI 来说是一个独特的优势:通过 X 平台,它拥有全球最大的实时社会对话数据流;通过 SpaceX 和 Tesla,它拥有世界上最复杂的工业和工程数据池。这种「数据飞轮」效应是其他竞争对手很难复制的。
工业部署正在从「API 调用」走向「嵌入式 AI」
Grok 4.5 在 SpaceX 和 Tesla 的私测代表了 AI 模型在企业落地中的一个范式转变:不再是「通过 API 调用一个外部模型」,而是「将模型嵌入到企业的核心工程和生产流程中」。这种差异至关重要——当模型被嵌入到火箭设计软件、自动驾驶训练平台和工厂管理系统时,它就不再只是一个工具,而是变成了基础设施的一部分。
开源生态的「大模型时刻」已经来临
Cohere Command A+ 和 NVIDIA Nemotron-3 在同一天的开源发布,加上 Zyphra、Poolside 等新玩家加入开源阵营,标志着开源 AI 模型正式进入了「大模型时代」。当 218B 和 550B 参数的旗舰级模型以开放许可证面世时,小型团队和创业公司将获得此前只有巨头才能企及的 AI 算力。这表明,AI 算力的民主化并不是通过「小模型变强」实现的,而是通过「大模型变便宜」实现的——开源社区正在推动这一进程。
六、总结
Grok 4.5 的私测消息是一个多重信号的汇集时刻:1.5T 参数 V9 基础模型证明了 xAI 的工程能力已跻身第一梯队,Cursor 数据补充训练开创了「过程性代码数据」的训练新范式,SpaceX 和 Tesla 的真实工业部署展示了 AI 模型从聊天工具向工业基础设施转型的可行路径。同一天 Cohere 和 NVIDIA 的开源旗舰模型发布则提醒我们:这场竞争已经不再是几个闭源巨头之间的排位赛,而是整个 AI 生态系统的全面升级。