8 月 21 日,DeepSeek 在 API 平台上线 experimental 多模态模型 deepseek-v4-flash-vision-exp,同日发布 DeepSeek Harness 0.1.1,开箱即用地支持新模型。这不是一次普通的小版本更新,而是把「视觉 agent」这个原本属于高价前沿梯队的Capabilities,塞进了每百万输入 token 仅 0.14 美元的最便宜前沿级模型里。
事情本身
新模型在保留 V4-Flash 全部文本能力(推理、世界知识、agent 行为)的前提下,新增图像与截图理解。DeepSeek 官方称,在 11 项多模态 agent 基准上,其表现贴近 Anthropic 的 Claude Opus 4.8:DeepSWE(软件工程 agent)反超 1.3 分、Agents' Last Exam 反超 1.6 分、ZeroBench(专为击碎视觉模型设计的硬基准)反超 1.0 分;仅在 NL2Repo(自然语言转仓库)上以 57.7 对 69.7 落后 12 分。图片按最多 384 token/张计费,与文本同价,单张截图成本约 0.000054 美元,一万张图约 0.54 美元。上下文窗口 100 万 token,单次请求最多 600 张图。
Harness 0.1.1 的配套同样关键:/goal、/plan 等命令可接收图文输入,@ 菜单可引用文件与会话,MCP/ACP 支持图片附件持久化,PTC Mode 支持转发嵌套图片;同时上线免费 Files API,上传一次按 file_id 跨请求引用,免去反复 base64。模型兼容 Chat Completions、Messages、Responses 三类端点,可直接嵌入现有 agent 框架。
为什么值得关注
第一,多模态正在从「 premium 层」沦为「 commodity 层」。半年前视觉模型是独立昂贵档位,现在 DeepSeek 把它捆进 budget 模型并按文本价计费,屏幕阅读、文档处理、视觉 QA 这类工作流不必再为前沿视觉能力付溢价。这对 agent builder 的账本是直接改写。
第二,agent 的「眼睛」和「手」开始解耦定价。模型会看图(视觉理解)+ Harness 会执行(工具调用)+ Files API 管素材,三者 coherent 地打包,意味着「截图进、动作出」的闭环可以在极低成本下跑起来。
第三,竞争压力外溢。GPT-5.6 Sol 档 0.20、Gemini 3.7 Flash 0.75、Grok 4.6 2.00 美元/百万输入,DeepSeek 这次把视觉 agent 的入门价压到一个数量级以下,逼着前沿 lab 重新思考「视觉到底该值多少钱」。
caveat:experimental 标签意味着 API 稳定性未承诺,生产系统应钉死预期;数据出境(API 在中国境外基础设施处理)对欧盟触发 GDPR 第五章传输规则,企业用户需自行评估。
一句话:当最便宜的模型都能看懂屏幕,agent 的平民化拐点到来了。
来源:DeepSeek 官方 X 公告与 API 文档、The Decoder、Times of India、新京报贝壳财经、ai-jarvis.eu 基准拆解。
讨论回复
加载中...正在加载回复...
推荐
智谱 GLM-5 已上线
我正在智谱大模型开放平台 BigModel.cn 上打造 AI 应用,智谱新一代旗舰模型 GLM-5 已上线,在推理、代码、智能体综合能力达到开源模型 SOTA 水平。