CMU提出AI自奖励训练SRT:数学能力暴涨100%,无需人类标注实现自我进化

[复制链接]
周大 发表于 7 天前 | 显示全部楼层 |阅读模式
CMU团队提出自奖励训练(SRT),使LLM无需人类标注即可实现自我进化,其推理能力在早期训练中媲美传统强化学习。SRT利用多数投票生成奖励信号,在数学和逻辑任务上表现出色,但于复杂数据集如DAPO上易出现性能崩溃。研究引入早停、固定基模型及课程学习策略,有效缓解该问题并提升模型稳定性与上限。
来源:https://mp.weixin.qq.com/s/-kjunzJJmeAF3mIfvk6RiA

Archiver|手机版|靠浦网络|靠浦ai课堂 ( 鄂ICP备17024134号-3 )

GMT+8, 2025-6-8 18:16 , Processed in 0.297181 second(s), 24 queries .

Powered by Discuz! X3.5

© 2001-2025 Discuz! Team.

快速回复 返回顶部 返回列表