马斯克发文透露 Grok 4.7 旗舰大模型已进入最后调试阶段。他指出当前强化学习(RL)算法存在对回答长度过度惩罚的问题,易导致模型在攻关复杂高难任务时过早妥协放弃,团队正专项优化长程自我验证逻辑,预计数日内发布。
核心要点速览 (Key Takeaways)
- ✓Grok 4.7 已完成基础能力训练,正针对强化学习奖励函数做精细调校
- ✓解决复杂数学与长代码生成中模型因长度惩罚过早放弃(give up too early)的缺陷
- ✓强化自我校验与推理反思机制,预计将在未来数天内正式向全量用户推送
讨论与评论
0登录后即可参与深度讨论
与广大 AI 开发者、工程师交流评测心得与前沿洞察