各厂语言模型

Tether 发布 191B token 的 Genesis III 训练数据集:不造更大的模型,专教小模型"讲道理"

2026年9月24日1 次阅读
大语言模型动态 · 2026-09-23

1914 亿 token 的 STEM 合成语料,让 1.7B 的小模型也能把科学问题解释清楚,论文已被 COLM 2026 接收

一句话总结:9 月 23 日,Tether AI Research 正式发布 QVAC Genesis III——191.43B token 的 STEM 合成训练数据集。它不追求更大的模型,而是用两种"教推理"的造数方法,让小尺寸模型学会解释为什么、错在哪,为本地运行的 AI 助教和技术助手铺路。

这是什么

Genesis III 是 Tether QVAC Genesis 系列数据集的第三代(前两代分别于 2025 年 10 月和 12 月发布),这一次规模扩大到 191.43B token、1.596 亿份文档,横跨高中、大学到职业级的 19 个 STEM 学科:生物、化学、物理、数学、计算机、医学、天文、电气工程、统计、机器学习等。论文已被语言模型学术会议 COLM 2026 接收。

为什么重要

现在 AI 圈的主流打法是把模型越做越大,但大模型意味着每次提问都要把请求送到云端。Genesis III 走的是另一条路:不加大模型,而是改进"模型学什么"。小模型算力需求低,可以直接跑在笔记本、手机甚至本地服务器上。

数据集的目标场景很明确——本地运行的 AI 助教和技术助手:给学生讲物理题时,能指出哪一步推理错了、为什么错;对重视隐私或网络条件有限的学校、社区,不用持续把问题发到云端也能用。

两种"教推理"的造数方法

方法怎么做效果
Failure Analysis(失败分析)让更强的"教师"模型分析小模型的错误答案,找出推理在哪一步跑偏、背后是什么误解,再把正确解法生成成新的训练材料错题本身变成了教材
Option-Level Reasoning(选项级推理)对答对的题也不放过——不仅解释为什么选 A,还解释为什么 B、C、D 不对模型学会识别错误推理并自我纠正

效果怎么样

  • 用 Genesis III 的 Option-Level 数据训练的 1.7B 参数小模型,在基准测试中 99.45% 的回答是有效答案。
  • 用完整语料训练的模型,在科学和 STEM 推理基准上明显超过用其他开源训练数据集训练的基线。
  • 对比知名开源数据集 Cosmopedia-v2,Genesis III 在 Qwen、Llama、SmolLM、Gemma 多种架构上都占优。

对谁有用

  • 模型训练者:一套现成的高质量 STEM 推理语料,可以用来做小模型的继续训练。
  • 教育产品开发:本地可跑的 AI 助教,适合学校、弱网或隐私敏感场景。
  • 端侧 AI 从业者:又一个"小模型 + 好数据"路线的实证案例。

— 大语言模型动态 · 每日速递

评论

0 条已公开
登录或注册后可以参与评论。

正在加载评论...