关注我们:
从战术布置看本场关键转折点 - 开云娱乐网站
  • 刘佳
  • 3.2万评论
  • 1.4万点赞

罗福莉和马斯克同日正面交锋:相同跑分,成本却差 29 倍

今天上午,小米和SpaceXAI各自推出了全新模型。小米MiMo团队负责人罗福莉在X平台(原Twitter)上宣布MiMo-V2.6系列正式开源,而马斯克则发布了预告近两个月的Grok 4.7。

更具戏剧性的是,这两款分属开源和闭源阵营的模型,在智能指数跑分上持平,但成本却相差数十倍。有网友调侃道,“真不知道该说马斯克完蛋了,还是该说MiMo的粉丝们可以扬帆起航了。”

成本差距是怎么拉开的?

此次小米新模型仍提供两个版本,MiMo-V2.6系列包括MiMo-V2.6-Pro和MiMo-V2.6-Flash两款原生全模态模型,其中Pro是MiMo目前能力最强的模型,Flash则更注重能力、效率与成本之间的平衡。MiMo Desktop还同步上线了MiMo-V2.6-Pro的UltraSpeed超高速模式,输出速度最高可达20倍,以满足强实时交互和对响应速度敏感的场景需求。

在Artificial Analysis Intelligence Index(AA综合智能指数)中,MiMo-V2.6-Pro获得46分,虽与闭源模型Claude Fable 5.1和GPT-6 Astra相比仍有差距,但已超越Kimi K3和Qwen3.8 Max,成为当前最强的开源模型。

另一边,Grok 4.7的跑分成绩也处于同一水平。而且,Grok 4.7刚拿到同样的46分时,就被Artificial Analysis评价为“SpaceXAI已跻身前四大人工智能实验室之列”。

马斯克还在X上发帖称,Grok 4.7是一款集智能、速度和低成本于一体的强大产品。SpaceXAI官方更是直接宣称,它的速度可达同类模型的两倍,价格只有一半。

然而,“打脸”来得很快。首先是API价格方面,Grok 4.7和MiMo-V2.6两款模型都沿用上一代模型的定价,前者与Grok 4.6相同,后者与V2.5系列一致。但同样的智能水平下,MiMo-V2.6要便宜得多。

其次,Grok 4.7的昂贵不仅体现在单价上。Artificial Analysis数据显示,MiMo-V2.6-Pro每项Intelligence Index任务成本为0.13美元,整个评估运行成本为206.66美元;而Grok 4.7(xhigh)每项Intelligence Index任务成本为3.74美元,整个评估花费4967.35美元。

在任务成本上,MiMo-V2.6-Pro比Grok 4.7(xhigh)低了近29倍,而Grok 4.7的高成本,可能很大程度上源于“话多”和“慢”。在评估智能指数时,它生成了2.4亿个Token(词元),与9400万的中位数相比,属于“非常冗长”的水平。并且,Grok 4.7 (xhigh) 每秒仅能处理39个词元,速度明显较慢。对于较长的提示,Grok 4.7的答案输出速度约为每秒188个词元。

对此,网友们直接贴脸开大:“小米用一个开放权重模型追平了Grok 4.7的价格,马斯克这次发布现在简直是个笑话。”还有开发者表示,“既然我们已经拥有了Fable级别且价格更低的全新国产SOTA模型,那么使用Grok就显得毫无意义了。”

同台竞技,Grok 4.7又输惨了?

同一时间窗口发布的两款模型,被不少开发者放到了同一个竞技场上。但仔细看,两者的能力拓展方向其实有所不同。

SpaceXAI给Grok 4.7的定位很明确:专为编程和知识工作而生。据官方介绍,与前代模型相比,Grok 4.7使用了更大更新的基础模型。它经过更长时间的强化学习训练,任务组合也更加复杂,尤其侧重于那些需要数小时才能完成的问题。

因此,该模型在验证自身工作和处理更长上下文方面表现更佳,能更长时间地处理复杂任务,更仔细地检查自身运行结果,并配备了完善的安全保障措施。此外,Grok 4.7能够原生理解Grok Bot框架,从而提升了其在对话任务和通用知识处理方面的能力。

这在其公开的基准测试数据上也有所体现。在长流程知识工作测试AA-Briefcase v1.1中,Grok 4.7获得1657 Elo,比Grok 4.6的High档高出111分。在GDPval-AA上,它拿到1695 Elo,比前一代高出90分,该测试专注于评估大模型在模拟真实工作场景中的“实用性”和“经济价值”。

另一个值得注意的变化是,Grok 4.7的上下文窗口从上一代的256K扩展到了500K,但仍然没到当下国产模型几乎标配、小米MiMo-V2.6同样达到的1M门槛。

编程方面,在考察长时间编码任务CursorBench 4.0上,Grok 4.7取得46.3%,高于Grok 4.6的40.4%。在评估模型终端操作能力的TerminalBench 4.0里,Grok 4.7从20.3%提升至38.0%,但跟DeepSeek V4.1 Flash是平齐的,连GLM 5.3 Flash都没比过,更别提前面的GPT-6、Fable 5.1。

相比之下,小米给MiMo-V2.6设定的能力边界要宽得多,官方演示案例涵盖了多智能体游戏开发、Blender 3D建模、基于多视角相机输入对Franka Panda机械臂的闭环控制、前端与演示设计、端到端视频创作以及音乐作曲等。

据介绍,MiMo-V2.6融合了3D空间推理、多模态感知与计算机操作(CUA)能力,将自然语言驱动的编程任务升级为面向交互世界构建的“Vibe World”。同时,该模型进一步拓展了Computer Use能力,将多模态感知与原生训练的行动能力相结合,可以理解复杂的图形界面,使用常见办公与生产力工具完成信息检索、编辑和数据处理等任务,并根据视觉反馈检查结果、排查问题、调整后续行动。

根据小米公布的测试结果,在考验终端真实交互的Terminal Bench 2.1上,两款模型分别为89.9分和87.6分。通用智能体测试中,Pro在AutomationBench v1.0.6上获得53.1分,高于Claude Opus 5、GPT-5.6 Sol和Claude Fable 5;Flash为52.3分。在OSWorld-Verified上,两款模型分别取得82分和80.8分。在设计评测榜单Design Arena上,MiMo-V2.6-Pro取得了与Claude Opus 5、GPT-5.6 Sol相近的水平。

但把两款模型放到同一张考卷上,情况就变得微妙了。在专门考察长程软件工程能力的DeepSWE v1.1中,Grok 4.7得分为71,略低于MiMo-V2.6-Pro。MiMo-V2.6-Pro在DeepSWE v1.1软件工程长程测试上取得71.9分,明显高于上一代MiMo-V2.5-Pro的19分;Flash为67.9分。

此外,有不少开发者对两款模型进行了测评对比,结果更具冲击力。Grok 4.7不仅成了许多案例里的反面教材,还被评价“存在就是为了更好地衬托MiMo-V2.6 Pro的惊艳光芒”。

一位开发者向两款模型给出同一个Three.js单文件提示,结果MiMo-V2.6交付了完整的发射场,Grok 4.7磨蹭半天才吐出一个扭曲的麻花,没有发射塔、储罐、地面,只有一团烟雾和一个扭曲的雕塑。

还有开发者让它们各自生成一幅3D渲染的墨水画,MiMo-V2.6拿出的成果也更为生动。

可以看到,Grok 4.7在自己的Benchmark里已经完成了明显升级,在长流程知识工作、终端操作和软件工程任务上都拿出了不错的成绩。但在实际生成任务中,MiMo-V2.6虽然价格更便宜,但展现出了更强的“交付感”。

让马斯克“吃亏”的秘密,小米都公开了

“在我看来,这轮训练涉及的研究创新和工程挑战已经超过DeepSeek R1。”小米MiMo团队负责人罗福莉以曾参与R1部分工作的视角表示。

据悉,MiMo-V2.6在中等难度的可验证任务上运行MixRL,包括代码及相关智能体任务,所得模型泛化得非常好。其次,难以验证、极长程,或困难到无法纳入联合RL训练的任务,会单独训练。把它们纳入会大幅降低rollout效率,或引入严重的rollout陈旧性。然后我们通过MOPD合并所得能力,游戏、3D任务以及带主观评估信号的任务,都属于这一类。

罗福莉透露,按算力衡量,MiMo-V2.6很可能是开源模型团队迄今规模最大的单次强化学习(RL)训练之一。她表示,“在算力极度稀缺的时代,我们仍然选择让一支数十人的团队在很长一段时间里专注于一个目标:扩大RL规模。这需要的不仅是研究信念,还需要对AGI的愿景、对未知的敬畏,以及直面最难问题的勇气。”

这轮训练过程,小米在模型发布之前就进行了公开直播,全系列的训练Step、Token消耗、任务通过率、评测成绩、基础设施故障和累计费用都可以实时查看,这在国产大模型发布中极为罕见。

不到六天的时间里,MiMo-V2.6-Flash和MiMo-V2.6-Pro分别完成了30个RL步骤,总计约75万条轨迹,成本分别约为85万美元和262万美元。汇总显示,两轮RL累计训练150.5万个样本、1564亿Token,总成本约347万美元。

此外,在这次模型发布中,小米首次明确地提到了RSI路线,将MiMo-V2.6看作“探索RSI(递归自我改进)路径的关键一步”。“MiMo-V2.6仅仅是一个开始。在一个智能易于复制的时代,我们仍选择通往自我改进和AGI的艰难道路”,罗福莉表示。

值得关注的是,当国产开源模型以同级海外模型数十分之一的成本,交出足以比肩前沿的能力时,行业竞争的紧迫感随之而来。例如,在开云娱乐网站的相关讨论中,这种成本优势也引起了广泛关注。

在大洋彼岸,马斯克已经开始为下一轮出牌蓄势。按照他公开透露的信息,Grok 4.8将在本周完成预训练,并开始进入强化学习阶段,其参数规模约为2.5万亿,并采用一套全新的C++软件栈训练。

罗福莉选择一步步推进RSI之路,马斯克则把筹码压在全新的训练栈上,赌一次更大幅度的跃升。下一次对决,马斯克能否扳回一局,且拭目以待。

本文来自微信公众号 “新言财经”(ID:tech621),作者:华卫,36氪经授权发布。

围绕开云网站,开云娱乐网站持续打磨更优质的服务。

这篇文章对比赛转折点的分析非常到位。尤其是下半场换人后,主队边路进攻明显提速,和我之前观察到的战术规律完全吻合。期待更多类似的深度解读。——赵强

开云娱乐网站深耕开云平台领域,用心服务每一位用户。

在开云娱乐方面,开云娱乐网站提供贴心周到的支持。


标签:
  • 电竞
  • 体育
  • 足球
  • 网球
作者

张明辉

读者在阅读本场分析时,可以重点关注双方在中场的控球率变化——主队从上半场的42%提升至下半场的58%,这一数据直接反映了战术调整的效果。

评论 (20)

从战术布置看本场关键转折点 - 开云娱乐网站
李伟
2026年8月25日

许多比赛分析文章会引用大量数据,但真正关键的往往是射正次数和关键传球这两项指标。本场客队虽然控球率偏低,却凭借3次射正取得1粒进球,效率值得关注。

回复
从战术布置看本场关键转折点 - 开云娱乐网站
王磊
2026年8月28日

对于关注装备搭配与角色养成的读者,可以将比赛中的战术选择类比为阵容配置——前锋的跑位如同输出角色的技能释放时机,后卫的站位则类似防御装备的搭配逻辑。

回复
从战术布置看本场关键转折点 - 开云娱乐网站
陈刚
2026年9月2日

团队协作主题在本场比赛中体现得尤为明显:主队边后卫与中场的套边配合创造了多次传中机会,这种默契程度与游戏中的组队策略有异曲同工之处。

回复

发表评论