合并请求 - UltraData-RL-2609:可用于小型 LLM 的强化学习后训练,提升数学、科学推理、长上下文和代码能力。项目提供约 8.6 万条可验证奖励 JSONL 数据,覆盖数学、知识、长上下文与代码,并强调可靠奖励和难度校准。【此简介由AI生成】 - AtomGit AI社区