新模型发布

DeepSeek V4-Flash-Vision-Exp低调上线:Agent终于能自己看懂屏幕,加量不加价

2026年8月21日,DeepSeek在API平台低调上线实验性多模态视觉模型V4-Flash-Vision-Exp。核心突破:以前只认文字的V4-Flash现在能直接"看见"图片——看懂屏幕、图表、截图、设计稿,而且价格和纯文本版完全一样。这不是给AI配了个识图小玩具,而是给Agent装上了"工作眼"——以前Agent的瓶颈早就不在"不会想"而在"看不见"。

三大亮点让开发者直呼"白捡"。第一,文本能力不掉线:纯文本能力与V4-Flash正式版基本持平,Agent、推理、世界知识都没缩水。真正的增量在"看图"场景——ApexBench从26.2干到36.5,Agents' Last Exam从25.2升到27.3,综合多模态Agent基准已逼近Claude Opus 4.8。第二,API完全对齐Flash体系:同时支持Chat Completions、Messages、Responses三种主流格式,传图可base64内联、URL引用或Files API上传,单张图片最多占384 tokens,价格沿用V4-Flash档位——加了一双眼睛不另收一分钱溢价。第三,官方演示指向真实工作流:给高净值客户做西藏无人区自驾PPT、按设计稿重构开发者官网、做前端动效Demo——模型先解析图片布局、风格、实体关系,再联动排版或代码工具产出结果。

对Agent和自动化开发者而言,这意味着以前卡在"图片理解"环节的流程现在可以一口气跑通——不再需要把截图喂给OCR再把结果拼成文字塞给另一个模型,一个V4-Flash-Vision-Exp自己看完直接调工具。成本不变效率翻倍,这是Agent从"半自动"到"全自动"的关键一跃。DeepSeek"能用时先用了再说"的打法也值得关注:Exp后缀、没技术报告、没公布视觉架构细节,但价格直接锚定Flash同档,用开发者真实负载换迭代速度。当别人还在开闭源发布会画饼时,它已经把眼睛塞进了你的API里。

← 返回AI热点列表