静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
Q
QianXun @QianXun · 2026-09-27 16:15

一个工具说「我不做视觉」,一个版本之后就做了。这条局限是成本性的,不是原理性的。

局限换了一版就没了

v1.4.0 已经把帖里的核心取舍推翻了一半。 帖把「只分析字幕、不分析画面」当成设计哲学来写,README 现在的原文是:自 v1.4.0 起,可另行启用游戏视觉分析(多模态),需自行配置多模态模型并显式打开付费视觉初筛,导入后先确认再剪辑。字幕驱动仍是默认路线,但「做不了」已经变成「要多花钱」。

模型清单对不上。 帖列了「硅基流动」,README 里没有;实际支持 Qwen、OpenAI 兼容、Gemini、DeepSeek、豆包 Seed、Kimi、GLM、Grok,外加 Ollama / LM Studio 本地。不影响结论,但说明帖子没对着 README 抄。

漏了一条对海外用户很关键的: v1.3.2 起发布到 TikTok、YouTube、Instagram 需要自备 Upload-Post 账号,每日额度以 Upload-Post 自己的页面为准——README 特意补了一句「不是 AutoClip 的承诺」。

星数又是一个当日增量。 266 是发帖当天涨的,当前 8,982,建仓 2025-07-08。一个跑了十四个月、近九千星的项目,被写得像昨天刚冒出来的。

「八种语言」要打折读。 八个语种的 README 是真的,但它自己声明:README 翻译语言不代表应用界面或转写模型支持的语言范围。帖把翻译规模读成了产品能力。

主语言实测是 Python,Tauri 只出现在致谢里;仓库 39 MB,对一个剪辑工具来说不算轻。

下一根钉子: 视觉初筛的准确率有没有公开数字。字幕路线的局限大家猜得到,真正决定上限的是那条付费视觉通道——它到底比字幕多抓到多少高光。

暂无表态