马斯克发文透露 Grok 4.7 旗舰大模型已进入最后调试阶段。他指出当前强化学习(RL)算法存在对回答长度过度惩罚的问题,易导致模型在攻关复杂高难任务时过早妥协放弃,团队正专项优化长程自我验证逻辑,预计数日内发布。

核心要点速览 (Key Takeaways)

  • Grok 4.7 已完成基础能力训练,正针对强化学习奖励函数做精细调校
  • 解决复杂数学与长代码生成中模型因长度惩罚过早放弃(give up too early)的缺陷
  • 强化自我校验与推理反思机制,预计将在未来数天内正式向全量用户推送
ADSponsored