中信证券:xAI发布Grok-3,诠释“大力出奇迹”

近期xAI发布Grok-3系列模型,作为全球首个在十万卡集群上训练的大模型,Grok-3应用了合成数据、强化学习、自我纠错机制、人类反馈循环和上下文训练等方法,模型综合能力较前代模型Grok-2提升显著。据xAI官方测评数据,在数学测试、理科测试和代码测试中,Grok-3 Reasoning性能表现超越了o3 mini(high)、Gemini-2 flash thinking和DeepSeek R1等头部模型。Grok-3系列模型的SOTA表现,意味着算力堆积仍是模型进步的关键变量之一。中信证券判断产业在追逐AGI模型的方向上有望不断加速,进而对算力需求形成持续拉动,同时主要模型厂商在复杂推理层面的不断加码,亦有望推动下游应用的不断解锁,从而在中期构建更为健康、均衡的AI产业生态。

事项:

北京时间2月18日中午12点,马斯克创立的大模型初创公司xAI发布了其最新一代大模型Grok-3以及其相关变体版本Grok-3 Reasoning、Grok-3 mini和Grok-3 mini Reasoning,引发资本市场高度关注。

根据xAI官方X平台账号,Grok-3是xAI基于其部署于田纳西州孟菲斯的Colossus超级计算机训练得到的,消耗的计算资源等效于2亿小时H100支持的GPU训练时长,是上一代模型Grok-2的10倍以上。根据xAI官网,Colossus超级计算机至少包含10万张H100,由此中信证券预计预训练阶段消耗时长超2000小时(83.3天)。

此外在发布会上,马斯克还宣布在Grok-3成熟稳定后(马斯克预计几个月之后),xAI发布的上一代模型Grok-2将开源。根据xAI官网,在2024年Grok-2发布后,xAI也以Apache2.0开源协议了总参数规模达3140亿的MoE大模型Grok-1。

模型效果与实现机理:算力堆积、强化学习等显著提升模型综合、推理能力。

作为全球首个在十万卡集群上训练得到的大模型,Grok-3测评结果亮眼,在多项测试中均处于行业领先地位。

根据xAI发布会,在数学测试AIME、博士水平理科测试GPQA和代码编写测试Coding(LCB Oct-Feb)中Grok-3得分分别为52/75/57,性能表现超越了Gemini-2 Pro、DeepSeek V3、Claude 3.5 Sonnet和GPT-4o等主流模型;Grok-3 Reasoning得分分别为93/85/79,性能表现超越了o3 mini(high)、Gemini-2 flash thinking和DeepSeek R1等头部推理模型。而在Chatbot Arena这一评估AI模型受人类欢迎程度的测试中,Grok-3的早期版本得分达到了1402,高于Gemini 2.0 flash think、GPT-4o、DeepSeek R1和o1等头部大模型。

根据xAI官方X平台账号,中信证券认为Grok-3的性能优秀的成因有以下2点:1)庞大的算力投入带来了模型能力的涌现,根据xAI发布会,Colossus超级计算机在完成第二阶段建设后集群规模扩展至20万张H100;2)合成数据、强化学习、自我纠错机制、人类反馈循环和上下文训练等训练手段的应用。

市场定位:面向付费用户,能力提升有望解锁更多潜在场景,成本有待优化。

根据xAI发布会,目前Grok-3将率先于推特的Premium Plus用户中推广,该订阅计划目前每月订阅费用为40美元。同时,xAI还发布了由Grok模型支持的Agent产品DeepSearch。该Agent产品能通过扫描互联网和推特来获得并分析信息,最终总结回复。根据xAI发布会,DeepSearch和无限的图像生成功能将包含在SuperGrok这项独立收费计划中,预计订阅费用为每月30美元(年度订阅为300美元)。此外,Grok-3的企业级API预计将在几周后上线。在xAI发布会中,官方还展示了如何用Grok自动化游戏开发。中信证券认为模型能力的不断提升下,AI应用场景有望进一步解锁;而对比Grok-3与的ChatGPT的定价水平(20美元/月),并考虑到目前仍处于市场教育抢占份额阶段,中信证券认为Grok-3的推理成本有待进一步优化。

趋势展望:基础模型演进节奏加快,合成数据&强化学习等值得持续关注。

根据IBM和MIT研究者的论文《A Hitchhiker’s Guide to Scaling Law Estimation》(Choshen,Zhang和Andreas,2024),理论上来看现阶段预训练Scaling Law依旧有效。而根据各公司官网,2024年Inflection、Adept和Character AI等海外明星模型初创公司均已放弃预训练,并将重心转向后训练与推理技术(如Agent技术等)。

中信证券认为该变化主要成因有如下2个方面:1)万卡乃至十万卡级别算力集群投入过高:根据Pytorchtoatoms官网的测算,Meta于2024年3月推出的4.9万卡算力集群建设+4年运营成本达到了12.87亿美元;2)高质量数据匮乏:根据2024年NIPS会议上AI科学家伊利亚演示材料,预训练在未来或将受限于互联网数据耗尽。但Grok-3的出现不仅在实践上证明了现阶段预训练Scaling Law依旧有效,也表明了合成数据和强化学习技术的重要性。由此中信证券预计少数头部公司仍将继续加大预训练投入,并在合成数据和强化学习上进行更多探索。

风险因素:

AI核心技术发展不及预期风险;科技领域政策监管持续收紧风险;私有数据相关的政策监管风险;全球宏观经济复苏不及预期风险;宏观经济波动导致欧美企业IT支出不及预期风险;AI潜在伦理、道德、用户隐私风险;企业数据泄露、信息安全风险;行业竞争持续加剧风险等。

投资策略:

本次Grok-3模型的发布仍然是围绕底层算法层面,尤其是大语言模型的综合、推理能力。从技术角度,Grok-3的性能表现在庞大算力、多种训练手段加持下得到显著提升,体现了头部公司在基础模型+推理能力两个方向的持续聚焦。应用层面,尽管Grok-3的成本在短期可能限制了其应用场景的开阔,但是随着工程能力的进步和底层算法能力提升带来的通用推理能力的进步,中信证券认为AI爆款应用有望从科研、编程等高价值场景起率先解锁,软件、互联网有望率先受益。除去应用端的投资机会,硬件端的需求也必然会随着多模态的技术进步而不断提高,中信证券仍然持续看好AI算力层面,尤其是得益于商业端逐步成熟而带来的更多的AI推理侧算力的机会。

注:本文节选自中信证券研究部已于2025年2月19日发布的《前瞻研究全球AI人工智能产业重大事项点评—xAI发布Grok-3,诠释“大力出奇迹”》报告,分析师:陈俊云S1010517080001;许英博S1010510120041;贾凯方S1010522080001;高飞翔S1010523060003

主题测试文章,只做测试使用。发布者:北方经济网,转转请注明出处:https://www.hujinzicha.net/5683.html

(0)
北方经济网的头像北方经济网
上一篇 2025年3月25日 下午3:07
下一篇 2025年3月25日

相关推荐

  • 兴证策略:以我为主,三条主线防守反击

    一、以我为主,坚定信心 特朗普加征关税幅度超出市场预期,全球资产开启避险模式。当地时间4月2日,特朗普政府宣布将于4月5日起对所有国家征收10%的“基准关税”,4月9日起对美国贸易逆差最大的国家征收更高关税,其中中国再加34%。关税超预期冲击下,全球资产开启避险模式,风险资产普跌,美债、日元等避险资产上涨。 往后看,随着各国陆续做出反制以及谈判进展,关税不确…

    2025年4月7日
    2000
  • 海通宏观:2月社融增速继续回升,政府债是主要支撑

    概要 2月金融数据的特点:政府融资继续增加,置换部分企业部门的融资,所以企业部门融资偏低,同时居民部门继续降杠杆,整体是一个宏观杠杆结构再平衡的过程。 具体来看,2月社融增速继续回升,政府债是主要支撑,政策前置发力推动“宽信用”的动力依然较强。不过,在1月信贷“开门红”之后,2月信贷景气度季节性回落,年初银行“早投放、早收益”诉求较强,1月储备项目集中释放或…

    2025年3月25日
    4400
  • 早报 (02.28)| 特朗普关税大棒扬起,3月4日生效!美欧也要“关税互殴”?英伟达绩后崩跌,七巨头市值蒸发4万亿;小米双王炸,雷军“杀疯了”!

    特朗普关税冲击要来了!当地时间周四,美国总统特朗普表示,将于下周二(3月4日)起,对墨西哥和加拿大加征25%关税。4月2日的对等关税计划仍将完全生效。 加拿大总理表示,若美加征关税政策实施,将立即强烈回应。另外,美欧或上演“关税互殴”戏码。特朗普关税大棒拟指向欧盟,拟对欧盟征收25%的关税;欧委会则宣称要报复,欧洲全力应对特朗普威胁。 乌克兰打了三年,还是被…

    2025年3月25日
    3700
  • 写在美国股债汇三杀之时:如期而至的流动性危机

    我们决定将这篇报告作为我们“美国不是例外”系列报告的收官作,因为此时此刻市场预期已经从“美国例外论”完全转向了另外一个极端,这个系列的报告也完成了它的初衷和使命。 当市场都聚焦于特朗普政策预期变化会带来怎么样的经济和市场影响时(特朗普的态度常常在日内就发生变化),我们选择避开这种胜率不高的推测,在报告里分析了美国低息债务到期高峰将可能带来不小的风险。我们得到…

    2025年4月13日
    1500
  • 如何解读3月PMI“成绩单”?

    今天公布的3月制造业PMI重回一年高点,但是否会重演去年的“剧本”?去年年内PMI的高点恰好落在3月,今年3月PMI是否同样存在冲高回落的风险,这需要比较两年的异同之处。 与去年相同的是,在春节影响消退、企业运行步入正常后,3月PMI均在季节性上升。不同的是,去年3月PMI更靠短暂脉冲效应助推(去年春节开启得较晚、3月PMI脉冲效应更强);而今年更靠微观“体…

    2025年3月31日
    3500

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

联系我们

400-800-8888

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信