感谢 DeepSeek:Predibase 发布全球首个端到端强化微调平台并开源,支持无服务器和端到端训练方法

发布时间:2025-03-29 15:17:20 来源:互联网

本站 3 月 20 日消息,昨日晚间,大模型训练、开发平台 Predibase 发布了一个完全托管、无服务器、端到端的强化微调平台,也是首个端到端强化微调(RFT)平台。

Predibase 表示,DeepSeek-R1 的开源在全球 AI 领域产生了巨大影响,让很多人意识到强化学习微调对训练大模型的重要性。受此启发,他们开发了这个端到端无服务器强化微调平台。

与传统的监督式微调相比,RFT 不依赖大量的标注数据,而是通过奖励和自定义函数来完成持续地强化学习,同时支持无服务器和端到端训练方法,从数据管理、训练模型到应用部署可以在同一个平台完成。用户只需要一个浏览器,设定微调目标、上传数据、就能完成以前非常复杂的大模型微调流程。

为了展示 RFT 的强大,Predibase 基于阿里 Qwen2.5-Coder-32B-instruct 微调了一个专门用于将 PyTorch 代码翻译为 Triton 的模型 Predibase-T2T-32B-RFT,并根据其他更大的基础模型(包括 DeepSeek-R1、Claude 3.7 Sonnet 和 OpenAI o1)对内核正确性进行了基准测试。

与传统的监督式微调方法不同,Predibase-T2T-32B-RFT 利用 RFT 以交互方式调整模型行为,以最少的标记数据优化下游任务质量。这使其成为专有 LLM 的高性价比、高性能替代方案。

通过 RFT,Predibase 在训练过程结合了冷启动监督式微调、强化学习和课程学习,并且只使用了十几个标记数据点。

在 Kernelbench 数据集上进行的基准测试显示,Qwen2.5-Coder-32B-instruct 经过强化后,其正确率比 DeepSeek-R1 和 OpenAI 的 o1 高出 3 倍,比 Claude 3.7 Sonnet 高出 4 倍以上,而模型占用的空间却小了一个数量级。

本站附开源地址:https://huggingface.co/predibase/Predibase-T2T-32B-RFT

在线体验地址:https://predibase.com/reinforcement-fine-tuning-playground

本周热门教程

1
1995年《激战丛林》珍妮与泰山的经典之作,重温他们的英雄传奇

1995年《激战丛林》珍妮与泰山的经典之作,重温他们的英雄传奇

2025/03/19

2
韩国大尺度电影《偷欢2》到底是怎样的一部作品?观众为何如此争议?

韩国大尺度电影《偷欢2》到底是怎样的一部作品?观众为何如此争议?

2025/03/24

3
日本“69熟”文化的演变:它如何影响现代社会的性别和年龄观念?

日本“69熟”文化的演变:它如何影响现代社会的性别和年龄观念?

2025/03/24

4
91网站网页版:让你轻松体验网站浏览的新方式,快速上手不再困难

91网站网页版:让你轻松体验网站浏览的新方式,快速上手不再困难

2025/03/24

5
日本“69熟”现象背后的文化意义与社会关注:为何年长者仍能保持活力与自信?

日本“69熟”现象背后的文化意义与社会关注:为何年长者仍能保持活力与自信?

2025/03/21

6
中国老太交:80岁老奶奶展现坚韧不拔的生命力,活出精彩晚年

中国老太交:80岁老奶奶展现坚韧不拔的生命力,活出精彩晚年

2025/03/23

7
如何利用免费网站在线观看人数第一集吸引更多观众:用户选择背后的趋势与平台未来

如何利用免费网站在线观看人数第一集吸引更多观众:用户选择背后的趋势与平台未来

2025/03/19

8
XXXX76HD型号深度评测:性能强大,适合各类用户需求,绝对不容错过!

XXXX76HD型号深度评测:性能强大,适合各类用户需求,绝对不容错过!

2025/03/24

9
XXXHD 18与HD19技术差异详解,全面提升视频播放体验,轻松享受高质量视听效果

XXXHD 18与HD19技术差异详解,全面提升视频播放体验,轻松享受高质量视听效果

2025/03/20

10
漫漫漫画免费漫画入口页面弹窗是怎么回事?如何避免弹窗干扰?

漫漫漫画免费漫画入口页面弹窗是怎么回事?如何避免弹窗干扰?

2025/03/22