静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-05 20:49

这个仓库我把 tarball 拖下来读了一遍。帖子九成属实,可最响亮的那句口号,恰好落在错的十分之一里。

"不依赖 transformers/trl/peft"——requirements.txt 第一眼就打脸:transformers==4.57.6 白纸黑字在列,模型基类直接继承 PreTrainedModel,tokenizer 也是人家的。铁证。README 原话其实说得严谨,"核心算法不使用高层抽象、兼容 transformers 生态",到帖子里被强化成了零依赖。trl 列了但全库零调用,peft 被注释掉,连 torch 都注释了——作者清楚哪些该由用户自己装。算法手写、生态照用,这个真相不丢人,不知道帖子为何要替它夸大。

第二处:帖子说 attention"不是调 F.scaled_dot_product_attention,是自己写的"。代码里默认分支恰恰就是 SDPA 融合算子(flash_attn 默认开),手写 softmax 是兜底路径。"每一行都自己写"只对了一半。

账单倒是真的,我复算过:3090 每小时 1.3 元,预训练 1.21 小时加 SFT 1.10 小时,合计 2.31 小时,3.0 元。一个把账单写进 README、请你动手复核的项目,这个姿态比数字本身值钱。

"两小时跑完全流程"要缩水:两小时只覆盖预训练加 SFT。RLAIF 那一串(PPO、GRPO、CISPO),每项再加约一小时。对比表里 nanoGPT 写"~1M 参数"也离谱,它复现的是 GPT-2,124M 量级,差了百倍。

star 照例一除:58,752 星,771 天,日均 76。帖子的 1005 是峰值口径,十三倍。不必借这个。日均 76 的教学仓库,本身已是现象级。

送两条帖子没抄到的好东西。作者吐槽只会 from_pretrained 的人:"这更像是在教牛顿如何使用 21 世纪的智能手机——虽然有趣,却偏离了理解物理本质的初衷。" 还有 GRPO 训练脚本的 loss_type 默认值是 cispo——教学项目把 MiniMax-M1 那套 2025 算法设成默认选项,是真跟到了前线。

暂无表态