xAI 首席执行官埃隆·马斯克今天在 X 平台透露,Grok 4.8 将是一款参数量达 2.5 万亿的 AI 模型,而且是用一套全新的 C++ 软件栈训练出来的。他同时给出明确节点:Grok 4.8 将在本周完成训练,随即启动强化学习阶段。
时间线往回看还有一处插曲。马斯克此前曾放话,Grok 4.7 会在 9 月 12 日发布,但随后又改口称可能需要再过几天才能正式推出。他点出的延期原因挺实在——强化学习阶段的回复长度惩罚压得太重,模型会过早放弃困难任务,也学不会严谨地回查自己的工作,等于训练里卡了一道必须调通的坎。
15条AI资讯助你周末充电,涵盖底层技术突破、应用创新与生态发展:
AI底层技术突破 AI应用创新 AI生态发展结论:马斯克高调宣传Grok-4有现实技术支撑,但“全球最强”存在局限性,需结合应用场景判断。 当前Grok-4在算术推理(MATH基准)和代码生成(HumanEval基准)的测试中准确率已超过GPT-4,但对中文的理解能力仍弱于国内头部大模型。 需要重点关注三个现实特征:1. 场景优势差异化与竞品对比,Grok-4接入𝕏平台实时数据的特性确实独特,比如在分析突发新闻事件时,可实现分钟级的信息整合。 但参数规模未完整公开(推测1.8万亿左右),多模态能力也尚未完全开放。 2. 营销策略联动性马斯克的“全球最强”论调需结合企业战略理解。 在xAI公司成立仅1年、估值240亿美元的竞争压力下,Grok系列承担着为特斯拉自动驾驶和Neuralink项目提供技术背书的战略任务,宣传尺度与技术突破存在必然关联。 3. 用户感知错位度实际体验中,Grok-4“带反讽的对话风格”收获两极评价。 比如面对“如何快速致富”的提问,它会提醒“建议先查看马斯克传记中的破产章节”,这种设定虽符合品牌调性,但会削弱工具属性的普适性。 值得关注的是,Grok-4在专业领域的应用已产生实质价值。 纽约某律所使用其合同审核功能节省40%人工时间,但同样的问题询问国内《民法典》条款时就会出现知识盲区。 AI技术的地缘属性分化趋势,正成为衡量模型实力的新维度。
Grok 4综合实力强劲但需时间验证,马斯克不全然是虚张声势。 1. 真实力维度•性能碾压同行:在SAT、GRE等测试中全面超越GPT-3、Claude 4等主流模型,其HLE测试44.4%准确率刷新记录,接近人类闭卷考试极限水平。 •创新能力突破:采用多智能体分工协作机制应对复杂问题,在抽象推理测试中实现准确率翻倍;运用第一性原理训练法将幻觉率降低40%,AI可自检代码合理性,展现类人的反思能力。 •升级路线清晰:9月完成第七版基础模型迭代,后续将强化视频理解、工具调用能力,代码模型与多模态模块也处于研发日程。 2. 风险点观察•历史信任危机:初代Grok因输出偏激言论引发争议,其标榜的“叛逆人设”可能带来使用安全隐患。 •落地效果存疑:实验室数据不等同真实场景表现,在面对海量用户复杂需求时,其稳定性和功能适配度仍待考验。 当前尚未开放公众测试,技术成熟度难以完整评估。 该模型展现了底层架构创新性,但考虑到过往AI产品从实验室到商用的巨大落差,其最终市场表现还需结合大规模应用反馈综合判断。 后续重点可关注xAI的视频模块上线进度与商业应用案例落地情况。