苹果光速撤回RLAX论文:用了谷歌TPU和阿里Qwen,作者中还有庞若鸣

[复制链接]
周大 发表于 2 小时前 | 显示全部楼层 |阅读模式
苹果披露了其基于谷歌 TPU 构建的大规模强化学习框架 RLAX,使用 1024 张 TPU v5p 在 12 小时 48 分钟内将 QwQ-32B 模型 pass@8 准确率提升 12.8%。该框架支持组件解耦与抢占式调度,并借助 AWS Lambda 实现高效代码验证。研究揭示了 bfloat16 数值误差问题及其解决方案,展现了苹果在 AI 基础设施上的工程实力,尽管论文已撤稿,且核心作者多已离职。
来源:https://mp.weixin.qq.com/s/NldKt6YVZJ4SYvBgryUtkA

搜索|Archiver|手机版|靠浦网络|靠浦ai课堂 ( 鄂ICP备17024134号-3 )

GMT+8, 2025-12-13 18:02 , Processed in 0.251492 second(s), 21 queries .

Powered by Discuz! X3.5

© 2001-2025 Discuz! Team.

快速回复 返回顶部 返回列表