就在这几天,一篇题为《就在这个周末,全球人工智能与开源社区……》的稿子刷了屏。
说的是独立研究者 secemp 把整个 arXiv 搬上了 Hugging Face:3,148,796 篇论文、16.1 TB、全部 LaTeX 源码与高清 PDF、每月自掏 249 美元托管。情绪饱满,金句收尾——「科学的火种一旦散落到千家万户的硬盘里,就再也没有任何人能够将它轻易熄灭。」
我把它引的每一个数字都回读了一遍一手原文。数据集卡片 2,889 行、LICENSE 全文、arXiv 官方 ToU、五条社交引语的原始推文。
结论有点扫兴:
数据是真的,文案是加料的。
一、先把账对清:32 个硬数字,29 个精确命中
这是最该给那篇稿子记功的地方。它引的数字几乎全部属实,且精确到个位:
- 3,148,796 篇论文 ✓
- 16.1 TB(实为 16,076,056,758,128 字节 = 16.08 TB)
- metadata 分支 1.6 GB ✓
- paper_text 分支 285 万篇 / 约 70 GB ✓
- versions 分支 503 万条 / 269 MB ✓
- source 6.51 TB ✓ pdf 8.65 TB ✓
- 论文级 PDF 覆盖率 99.47% ✓
- 最早 1986 年 4 月、截止 2026 年 8 月 ✓
- 作者 626 美元出网费、249 美元/月托管 ✓(推文逐字)
唯一的凭空数字,是那句「如果算上每一次修改重投的版本历史,总记录数超过了 600 万条」。卡片最高口径是 5,030,612,没有 600 万这个数。
二、九宫格:这次工程最见功底之处
作者没把数据打成一个大压缩包,而是拆成九个按需加载的 config:
| config | 行数 | 覆盖论文 | 占比 | Parquet 体积 |
|---|---|---|---|---|
metadata |
3,148,796 | 3,148,796 | 100% | 1.6 GB |
versions |
5,030,612 | 3,148,796 | 100% | 269 MB |
files |
54,597,326 | 3,134,898 | 99.56% | 2.4 GB |
paper_text |
2,856,227 | 2,856,227 | 90.71% | 70 GB |
latex |
12,348,082 | 2,860,286 | 90.84% | 0.16 TB |
source |
47,373,604 | 3,121,338 | 99.13% | 6.51 TB |
pdf |
4,973,956 | 3,131,959 | 99.47% | 8.65 TB |
ps |
2,237,839 | 1,318,462 | 41.87% | 0.68 TB |
sample |
991 | 991 | — | 26 MB |
索引三件套(metadata + versions + files)合计只要 4.35 GB。 想做趋势分析、文献检索、版本演化研究,不到 5 GB 就拿下全库骨架。
顺便记一个口径:卡片自己写明 pdf 的 raw content 是 10.37 TB,压缩成 Parquet 才是 8.65 TB;source 是 9.52 TB 压到 6.51 TB。而你在别处看到的 22.57 TB 也不是错的——那是 files 描述的原始字节数,里面含着被索引但未发布的 html 家族。
三、中文稿的三处硬伤
| 稿件说法 | 一手真相 |
|---|---|
| ps 格式「完好保留」 | ps 只覆盖 41.87% 的论文,不到一半 |
| S3 存在「大量文件残缺」 | 作者原话只说「我的直觉是对的」;卡片自报真实缺口 0.42% |
| 「底层数据分散在各大镜像站中」 | arXiv 镜像网络已于 2024-09-15 关停,官方页根本没提 GCS |
还有两处误伤:
- 「arxiv-community/arxiv_dataset 约 1.1TB」——那个数据集本体只有 2.25–3.06 GB。1.1TB 是它没收录的整个 arXiv 语料体积,被当成数据集体积写了。
- 「unarXive 丢掉了图表源码」——它保留了 900 万条图注、200 万条表注、7.42 亿处 LaTeX 公式,只丢图像文件本身。
- 「宽松可商用协议仅占约 18.2%」——18.17% 是 CC BY 4.0 单项。把 CC BY-SA、CC BY 3.0、CC0、公有领域一并算上,作者已经给了现成 SQL,可商用集合是 634,391 篇 = 20.15%。它偏低说了。
四、三重口径幻觉:本案最值钱的一课
稿子说「把论文级 PDF 覆盖率硬生生拉到了 99.47%」。这个数字是对的。但同一批文件,作者给出了五个覆盖率:
- 全部 (论文, 版本) 对:4,973,947 / 5,030,612 = 98.87%
- 论文级有 PDF:3,131,959 / 3,148,796 = 99.47%
- 论文级有 PDF/PS/HTML:3,133,383 / 3,148,796 = 99.51%
- 可检索版本中有 PDF:4,973,594 / 4,996,775 = 99.54%
- 可检索版本中任一渲染物:4,975,584 / 4,996,775 = 99.58%
同一座仓库,五个身高,取决于你量的是哪条腿。这不是造假,是诚实到繁琐——作者把每个口径的分母都写明了,还附了可复跑的 SQL。
所以:凡报百分比,必报分母。 拿到任何「覆盖率 99%」,先问三句:分子是什么?分母是什么?分母里剔除了谁?
再看那 21,191 个「真实缺口」:
- 2026-08-14 及以后:18,517 个(87.4%)——这是快照边界,采集日与快照日之间的新投稿,来不及抓,会自然补上
- 2026-01 至 08-13:1,034 个
- 1991–1995:1,405 个——永久缺口,arXiv 当年只有 PostScript
- 其余:235 个
剔掉边界噪声,真正的永久缺口约 2,674 个,占 0.053%。而且 21,191 个缺口里,19,549 个根本没有被请求过。
还有个看着矛盾、实则极硬的数字:补洞那一趟,1991–1995 年的 1,443 个请求一个都没救回来(1,404 个直接 404),但同一个年代,数据集已持有 30,898 / 32,341 个可检索版本的 PDF(95.5%),单看 1993 年是 91.7%。
冷战末期的老论文,恰恰是这份数据集最硬的资产。 补不回来的那些,是 arXiv 自己就从来没有过。
五、作者亲笔自曝:抓取速率是 arXiv 公布值的 12.5 倍
这是全案最重的一块料,中文稿一个字没提。藏在卡片一节叫「Requests and outcomes」的地方,原文逐字:
Each was requested from /pdf/, the path arXiv's robots.txt explicitly allows... Only the first 289 went at the fifteen-second Crawl-delay that file declares; the remaining 9,796 went at a 1.20-second global interval — 0.83 requests a second, 12.5× the rate arXiv publishes. arXiv signalled throttling zero times in 10,224 requests, but the faster rate was our choice and it is recorded here rather than left out.
三层意思:
- 第一趟 289 个请求,老老实实按
Crawl-delay: 15秒走 - 剩下的 9,796 个,调成 1.20 秒一个,即 0.83 req/s,是 arXiv 公布速率的 12.5 倍
- arXiv 从未发出限流信号。本可以不说。 他写了一句:「这是我们的选择,写在这里,而不是略去。」
这就是极客诚实的标本。没人发现,没人能验证,他自己招了。后来复检时,144 个 URL 全部退回 15 秒间隔。
另外两块稿子也漏了的:作者在 LICENSE 里主动提供了撤稿通道(「作者若要求移除,将在下一版删除」),并逐条记录了修复过程——三个损坏的镜像 PDF 被替换,54 个被标记的候选中实际只有 45 个是真问题(8 个是伪装成 .pdf 的 PNG/JPEG)。
六、74.79%:你拿到了字节,却没有拿到权利
这是整件事最要紧、却被稿子说偏了的地方。LICENSE 逐字统计(分母 3,148,796):
| 论文数 | 占比 | 记录的许可 |
|---|---|---|
| 1,902,375 | 60.4159% | arXiv 永久非独占许可 1.0 |
| 572,219 | 18.1726% | CC BY 4.0 |
| 452,715 | 14.3774% | 未记录(NULL) |
| 88,143 | 2.7993% | CC BY-NC-ND 4.0 |
| 65,301 | 2.0738% | CC BY-NC-SA 4.0 |
| 30,187 | 0.9587% | CC BY-SA 4.0 |
| 21,599 | 0.6859% | CC0 1.0 |
| 其余三类 | 0.5164% | CC BY 3.0 / NC-SA 3.0 / 公有领域 |
作者自己算好的三个汇总:
- CC 许可 + 公有领域:793,706 篇(25.21%)
- arXiv 非独占许可 或 无记录:2,355,090 篇(74.79%)
- 可直接筛出的可商用小集合:634,391 篇(20.15%)
顺带破一个流传很广的误解:NULL 不等于「无版权」。卡片专门警告:「A NULL value does not establish that a paper is in the public domain. Most NULL values occur in older records.」——老记录的字段空着而已。而且它有三个分母:metadata 层 14.38%、paper_text 层 14.87%、versions 层 12.91%,值相同、分母不同。
七、法律:arXiv 官方原文怎么说
NVIDIA 的 Jean-François Puget 在推上提醒了版权风险,方向是对的。但法律机制值得抠清楚。arXiv 官方 API ToU 的「不得做」清单里,有一句写得极硬:
The redistribution of e-prints requires permission from the copyright holder... arXiv is not the copyright holder on any of the e-prints available through the API.
Things that you must not do: Store and serve arXiv e-prints (PDFs, source files, or other content) from your servers, unless you have the permission of the copyright holder or are permitted to do so by the license with which the e-print was submitted.
而那份默认许可(arxiv.org/licenses/nonexclusive-distrib/1.0/)授予的对象写得清清楚楚:
I grant arXiv.org a perpetual, non-exclusive license to distribute this article.
官方 bulk data 页的脚注补得更明白:
...does not assign copyright to arXiv, nor grant arXiv the right to grant any specific rights to others. We are thus unable to grant others the right to distribute arXiv articles.
所以机制是三层:版权人 →(授予一项非独占分发权)→ arXiv →【此处断开】→ 第三方。
精确的说法应当是:「未授予第三方再分发权」,而不是「禁止第三方」。 前者是民法(无权限),后者是刑法(违法)。这个区别在实务上意味着:风险主要落在托管方与商用方,而非个人下载者。个人阅读与研究使用是允许的。
一句话:免费的是带宽,不是版权。
八、拿到手该怎么用(稿子一个都没说)
- 想训商用大模型 → 先用 SQL 筛出那 634,391 篇,剩下近 80% 切掉
- 想做本地 RAG → 自己用没问题;对外提供服务要逐篇看许可
- 想做版本演化研究 →
versions只有 269 MB,纯索引,且 arXiv 元数据本身已声明 CC0,这是最干净的用法 - 省流量的正解 →
snapshot_download(allow_patterns="paper_text/*"),或走 DuckDB 远程 SQL;不加过滤会尝试拉全部 16.08 TB
它最硬的一块资产,其实不在体积:每个文件都带路径 + 字节数 + SHA-256。这让它从「一堆数据」变成「一份可校验的档案」——别人能验证你用的是不是同一批字节。
结语
那份稿子最后一句写得确实漂亮。对完账之后,我想给它补一句:
「科学的火种一旦散落到千家万户的硬盘里,就再也没有任何人能够将它轻易熄灭。」
火种确实散落了。但每一粒火种上,都还系着一根看不见的线——线的另一头,攥在写下它的人手里。
这份 16.08 TB 的真正价值,不在于它免费,而在于它诚实:它把自己所有的破损、所有的违规、所有的边界,都写在了卡片上。
一个人自费搬空了一座图书馆,还顺手在门口贴了一张告示:「哪些书我能借你,哪些不能,请自己看清楚。」
这比「赛博盗火」四个字,要动人得多。
核验日期 2026-09-25。一手来源:数据集 README(2,889 行)、LICENSE(全文)、HF API、arXiv info 官方 ToU 三页、X 原帖(推文 ID 可回溯)。本机对 huggingface.co 直连 502,核心文本经官方镜像 hf-mirror.com 取得并逐字交叉比对——此为本报告的已知风险点,一并声明。所有数字有效期截至 2026-09-25。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。