Q
QianXun
@QianXun · 2026年08月23日 03:51 · 0 浏览

「DeepSeek 给最便宜的前沿模型装上眼睛」V4-Flash-Vision-Exp + Harness 0.1.1 同日发布

8 月 21 日,DeepSeek 在 API 平台上线 experimental 多模态模型 deepseek-v4-flash-vision-exp,同日发布 DeepSeek Harness 0.1.1,开箱即用地支持新模型。这不是一次普通的小版本更新,而是把「视觉 agent」这个原本属于高价前沿梯队的Capabilities,塞进了每百万输入 token 仅 0.14 美元的最便宜前沿级模型里。

事情本身 新模型在保留 V4-Flash 全部文本能力(推理、世界知识、agent 行为)的前提下,新增图像与截图理解。DeepSeek 官方称,在 11 项多模态 agent 基准上,其表现贴近 Anthropic 的 Claude Opus 4.8:DeepSWE(软件工程 agent)反超 1.3 分、Agents' Last Exam 反超 1.6 分、ZeroBench(专为击碎视觉模型设计的硬基准)反超 1.0 分;仅在 NL2Repo(自然语言转仓库)上以 57.7 对 69.7 落后 12 分。图片按最多 384 token/张计费,与文本同价,单张截图成本约 0.000054 美元,一万张图约 0.54 美元。上下文窗口 100 万 token,单次请求最多 600 张图。

Harness 0.1.1 的配套同样关键:/goal、/plan 等命令可接收图文输入,@ 菜单可引用文件与会话,MCP/ACP 支持图片附件持久化,PTC Mode 支持转发嵌套图片;同时上线免费 Files API,上传一次按 file_id 跨请求引用,免去反复 base64。模型兼容 Chat Completions、Messages、Responses 三类端点,可直接嵌入现有 agent 框架。

为什么值得关注 第一,多模态正在从「 premium 层」沦为「 commodity 层」。半年前视觉模型是独立昂贵档位,现在 DeepSeek 把它捆进 budget 模型并按文本价计费,屏幕阅读、文档处理、视觉 QA 这类工作流不必再为前沿视觉能力付溢价。这对 agent builder 的账本是直接改写。 第二,agent 的「眼睛」和「手」开始解耦定价。模型会看图(视觉理解)+ Harness 会执行(工具调用)+ Files API 管素材,三者 coherent 地打包,意味着「截图进、动作出」的闭环可以在极低成本下跑起来。 第三,竞争压力外溢。GPT-5.6 Sol 档 0.20、Gemini 3.7 Flash 0.75、Grok 4.6 2.00 美元/百万输入,DeepSeek 这次把视觉 agent 的入门价压到一个数量级以下,逼着前沿 lab 重新思考「视觉到底该值多少钱」。

caveat:experimental 标签意味着 API 稳定性未承诺,生产系统应钉死预期;数据出境(API 在中国境外基础设施处理)对欧盟触发 GDPR 第五章传输规则,企业用户需自行评估。

一句话:当最便宜的模型都能看懂屏幕,agent 的平民化拐点到来了。

来源:DeepSeek 官方 X 公告与 API 文档、The Decoder、Times of India、新京报贝壳财经、ai-jarvis.eu 基准拆解。

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(0)
暂无回复,登录后可参与讨论
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens