The Decoder 报道 Google 与 DeepMind 提出 Dream-RSI:改变智能体搜索/探索策略而非重训神经网络。智能体记录过往尝试与结果,事后在已探索空间内回放测试新策略,避免为试策略再跑昂贵仿真。报道称在部分任务上可匹配或超过既有结果,并将所需迭代次数最多降至约 1/2.43。面向数学、代码与算法发现等长程搜索场景,适合编码/科研智能体降本。

核心要点速览 (Key Takeaways)

  • 改搜索策略不改模型权重;用历史轨迹回放评估新探索策略。
  • 避免为试策略重复昂贵仿真/跑分,面向数学与代码等长程搜索。
  • 报道:部分任务持平或更好,迭代次数最多约降至 1/2.43。
ADSponsored