当前位置:主页 > 业界 > 正文

SpaceXAI新“[*]器”:Grok 4.6智能体测试力压GPT-5.6、Fable 5,定价仅竞品一半

发布时间:2026-08-13 已有: 位 网友关注

  美东时间8月12日周三,马斯克旗下SpaceXAI正式发布新一代大模型Grok 4.6。SpaceXAI称,新模型相比Grok 4.5实现显著提升,重点强化长时间运行的智能体、复杂编程、知识工作以及交互式和

  此次发布最受关注的并非单纯的模型迭代,而是Grok 4.6在SpaceXAI公布的多项前沿模型测试中已经跻身第一梯队,同时API起售价仅为2美元/百万输入Token、6美元/百万输出Token。SpaceXAI称,其定价约为其他前沿模型的一半;该模型上线首周在Cursor和Grok Build中还提供2倍包含用量。

  马斯克随后在社交媒体转发有关Grok 4.6是巨大升级、在所有基准测试中得分均超过Grok 4.5 High的帖子,强调Grok 4.6评分达到1753 Elo,并自夸新模型太牛了。

  Grok 4.6此次升级的核心,不再只是回答问题,而是让模型能够持续完成需要多步骤执行的复杂任务。

  SpaceXAI表示,Grok 4.6重点针对长时间运行的智能体进行训练,可以连续完成研究主题、分析信息、处理代码库,以及把一个模糊的产品想法转化为可运行的应用或工作成果。公司还称,新模型在更长的任务轨迹中开始表现出更多自主测试和验证能力,会在继续执行之前检查此前的工作。

  在训练方面,Grok 4.6经历了比Grok 4.5更长的补充训练,加入经过筛选的模型生成推理数据、高质量工程数据,并改进优化器和训练方案。随后,SpaceXAI利用Grok 4.5生成覆盖不同推理强度、智能体框架以及STEM、软件工程和知识工作的SFT轨迹,并进一步通过强化学习训练模型完成通用编程、知识工作、内核优化、网页开发和计算机辅助设计等任务。

  SpaceXAI特别强调,Grok 4.6在把“想法”变成“产品”方面有所提升。对于一个具体的产品构想,模型可以先研究陌生领域、设计应用结构、实现核心交互,再根据反馈进行多轮迭代;在

  作为对比,SpaceXAI在公告中将Grok 4.6定位为“其他前沿模型的一半价格”。而投资机构Atreides Management首席投资官Gavin Baker的评价更为激进:他认为,Grok 4.6的性能大致相当于Fable 5 Max,但输入Token价格低80%、输出Token价格低88%,因此在性能与成本的组合上具有明显优势。

  需要指出的是,API单价并不能完全等同于实际使用成本。不同模型的Token消耗、推理强度和任务完成路径存在差异,因此“便宜一半”主要是对公布API价格的比较,而不是意味着所有具体任务的最终成本都恰好低50%。

  首周促销也进一步强化了这一低价策略:SpaceXAI表示,Cursor和Grok Build用户在首周可以获得2倍包含用量,让开发者可以低成本试用Grok 4.6。

  从测试结果看,Grok 4.6的提升尤其集中在智能体执行真实工作这一正在成为AI模型竞争核心的领域。

  SpaceXAI重点展示了Artificial Analysis推出的GDPVal-AA v2。该测试基于OpenAI的GDPval数据集,考察模型在真实世界、具有经济价值的专业任务中的表现,覆盖44个职业和9个主要行业;模型需要在智能体环境中使用Shell和网页浏览等工具完成任务,并通过盲测两两比较最终产出的文件,由此形成Elo评分。

  但Grok 4.6并非在所有测试中都占据第一。例如在DeepSWE 1.1和Terminal-Bench v3.0中,SpaceXAI公布的GPT-5.6 Sol Max成绩仍高于Grok 4.6。因此,更准确的说法是,Grok 4.6已经在多项智能体和知识工作测试中进入前沿模型第一梯队,而不是全面击败所有竞争对手。

  值得注意的是,Artificial Analysis的GDPVal-AA v2排行榜本身会随着模型新增和评测更新而变化,因此标题所称的“力压”特指SpaceXAI此次发布时公布的横向测试结果,而非宣称Grok 4.6在所有时间、所有评测体系中均排名第一。

  Grok 4.6的发布还显示,SpaceXAI正在把竞争从单纯的模型性能比拼,进一步延伸到开发者入口和应用生态。

  而Atreides Management的Gavin Baker则进一步把市场注意力引向下一代产品。他预计,Grok 4.7将是规模明显更大的模型,并可能将Cursor和SpaceX数据纳入预训练。这一说法目前属于投资人士的判断,并非SpaceXAI此次发布公告确认的产品路线能够在保持前沿模型级别能力的同时持续维持较低的Token价格,那么其意义可能不仅是一代模型的性能升级,更可能成为

  :当不同厂商的模型能力差距逐渐缩小时,性能与推理成本之间的平衡,可能越来越成为开发者和企业选择模型的关键。

温馨提示:所有理财类资讯内容仅供参考,不作为投资依据。