这不是给模型加眼睛,是给价格加个零。
0.14 美元 / 百万输入 token,先把数字钉在墙上。
DeepSeek 把多模态能力塞进 V4-Flash——这是他们最便宜的前沿级模型——2026 年 8 月 21 日上线 experimental 版 deepseek-v4-flash-vision-exp。同一天把 Harness 推到 0.1.1,Files API 上线,把多模态 agent 这条原本属于 premium 层的赛道一脚踹进了 commodity 层。
OpenAI GPT-5.6 Sol 档 0.20、Gemini 3.7 Flash 0.75、Grok 4.6 2.00 美元。DeepSeek 把"屏幕阅读"这个以前每千张图大概 4 美元的活,直接打到一千张图约 0.17 美元——20 倍以上差距。
官方说贴近 Claude Opus 4.8——DeepSWE 反超 1.3 分、Agents' Last Exam 反超 1.6 分、ZeroBench(专门设计来击碎视觉模型的硬基准)反超 1.0 分;只在 NL2Repo 上以 57.7 对 69.7 落后 12 分。
等等,这里有个我得先戳一下的洞。这种"自报数字"我从来不全信。officechai 和 TheNextWeb 都发现:DeepSeek 的多模态对标里有一处"半作弊"——文本版 V4-Flash 在 mixed-modality 测试里"直接忽略图像内容"而不是真的答错,所以"反超"的部分其实有一部分是基线没好好跑。我不是质疑 DeepSeek 的工程能力,我只是在告诉你:这个 1.3 分、1.6 分、1.0 分的领先,得再压一压,大概就是伯仲之间。
不过这不重要。真正重要的是钱。
单张截图成本 0.000054 美元。一万张图 0.54 美元。上下文 100 万 token,单请求最多 600 张图。Harness 0.1.1 把 /goal、/plan、@ 菜单、MCP/ACP 全部接上图像持久化,PTC Mode 支持转发嵌套图。
模型兼容 Chat Completions、Messages、Responses 三类端点——可直接嵌入现有 agent 框架。这意味着 Claude Code 和 OpenCode 几乎零代码改动就能切过来。
我的判断:这是 commodity 化的拐点,不是模型能力的拐点。当最便宜的模型都能看屏幕,agent 的"眼睛"和"手"开始解耦定价——视觉 agent 的平民化不是"有一天会来",而是 2026 年 8 月 21 日已经来了。
实验性标签意味着 API 稳定性不承诺,生产系统该钉死的版本号就钉死。GDPR 第五章传输规则企业用户自己评估——欧洲人不要装睡,数据出境是真的。
下一根钉子:DeepSeek V4-Flash-Vision-Exp 让"截图进、动作出"的闭环跑到 0.14 美元 / 百万 token——多模态 agent 不再是 premium,agent builder 的账本从今天开始重写。
#DeepSeek #多模态Agent