新架构模型HRM-Text创新纪录,1B参数、1000美元,图灵奖得主都亲自下场了 文章

36kr 资讯2026-06-09NEWSzh作者: 机器之心

详细信息

来源站点
36kr 资讯
作者
机器之心
文章类型
NEWS
语言
zh
发布日期
2026-06-09

摘要

一个约 1B 参数的模型,在 MATH 上拿到 56.2,在 GSM8K 上拿到 84.5,在 ARC-Challenge 上拿到 81.9。训练成本约 1500 美元,16 块 H100 跑了不到两天。 这是 Sapient Intelligence 于 2026 年 5 月 18 日发布的 HRM-Text,团队同步开放了论文、模型权重和预训练代码。 如果只看这些数字,最直觉的反应可能是:这是不是某种微调的结果?站在巨人的肩膀上,当然省力。 但 HRM-Text 不是。它从零开始预训练,只使用了约 40B unique tokens(考虑重复采样后,实验表中的总训练量记为约 60B tokens),大约是 Llama 3.2 3B(9T tokens)训练量的 1/225,Qwen3.5 2B(36T tokens)的 1/900。 HRM-Text 与其他模型在训练 FLOPs、训练 tokens 和 benchmark 上的对比。 问题自然就来了:怎么做到的? 过去几年,大模型行业形成了一套近乎默认的增长逻辑:模型更大、数据更多、算力更强,智能能力就会继续提升。 这条路线已经被充分证明有效。GPT、Claude、DeepSeek、Qwen 等模型的持续演进,都离不开参数规模、数据规模和训练算力的扩张。但与此同时,基础模型训练也越来越像一项重工业:更长的训练周期、更昂贵的 GPU 集群、更复杂的数据工程,以及越来越高的入场门槛。 但 HRM-Text 想尝试另一种思路:在有限数据和有限算力下,能否通过架构与训练目标的共同设计,提高每一次计算的产出? 论文标题已经直接给出了它试图挑战的方向:Efficient Pretraining Beyond Scaling。 论文标题:HRM-Text: Efficient Pretraining Beyond Scaling 论文地址: https://arxiv.org/abs/2605.20613 GitHub: https://github.com/sapientinc/HRM-Text Hugging Face: https://huggingface.co/sapientinc/HRM-Text-1B…

摘要可能不完整,可查看原文

相关事件

暂无数据

相关公司查看全部 (3)

相关人物

暂无数据

相关技术

暂无数据