MiMo-7B-RL 是小米开发的一个 70 亿参数 的语言模型系列中的一个特定版本。它特别强调通过强化学习(RL)进行后训练,以解锁和提升模型固有的推理潜力。这个模型是基于 MiMo-7B-SFT 模型进一步训练而成的,在数学和代码推理任务上表现出色,其性能可与 OpenAI 的 o1-mini 模型媲美。
情報
- 番組
- 頻度アップデート:毎日
- 配信日2025年5月5日 2:47 UTC
- 長さ8分
- 制限指定不適切な内容を含まない
MiMo-7B-RL 是小米开发的一个 70 亿参数 的语言模型系列中的一个特定版本。它特别强调通过强化学习(RL)进行后训练,以解锁和提升模型固有的推理潜力。这个模型是基于 MiMo-7B-SFT 模型进一步训练而成的,在数学和代码推理任务上表现出色,其性能可与 OpenAI 的 o1-mini 模型媲美。