查看: 11|回复: 0

DeepSeek V4-Flash-Vision-Exp多模态模型上线,视觉Agent能力接近Opus-4.8

[复制链接]
发表于 昨天 05:34 来自手机 | 显示全部楼层 |阅读模式
8月21日,DeepSeek在API平台上线了全新的多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp。该模型目前处于实验阶段,开发者通过设置model参数为deepseek-v4-flash-vision-exp即可调用。
从定位来看,这款模型主打文本与多模态能力的平衡。在纯文本场景包括Agent、推理和世界知识等方面,它的表现与DeepSeek-V4-Flash正式版基本持平,不会因为增加了视觉能力而牺牲原有的文本功底。而在需要视觉理解的Agent Benchmark测试中,相比纯文本版本的Flash实现了明显提升,多模态Agent能力已接近Opus-4.8的水平。
API接入方面,该模型与现有的DeepSeek-V4系列共享相同的Base URL,同时支持OpenAI格式和Anthropic格式调用。基础配置保持了V4系列的水准,上下文长度支持1M tokens,最大输出长度可达384K。功能层面,Json Output、Tool Calls、Responses API、Anthropic API以及对话前缀续写等特性均已支持,不过FIM补全功能在该实验模型上暂不可用。
价格方面,V4-Flash-Vision-Exp沿用了Flash系列的定价策略,输入和输出成本与deepseek-v4-flash保持一致,相比Pro版本具有明显的成本优势。并发限制也设定为2500,与Flash同级,能够满足较高并发的业务需求。
对于需要处理图片输入的场景,该模型支持JPEG、PNG、GIF和WebP四种常见格式。单个请求最多可携带600张图片,通过Files API上传时单张图片上限为64 MiB,而使用base64或外部URL方式则限制在32 MiB。图片尺寸方面,常规情况下单边最长支持8192像素,如果单次请求包含15张及以上图片,尺寸上限会调整为4096像素。请求体总大小不超过48 MiB,整体配额对于多数视觉应用来说比较充裕。
如果你正在寻找一款在保持文本能力的同时具备较强视觉理解能力,且调用成本较低的模型,这款实验性质的V4-Flash-Vision-Exp值得尝试。不过需要注意的是,作为实验版本,其功能和支持情况可能会随迭代有所调整,建议在生产环境大规模使用前保持关注。
万狸温馨提示:理性消费
1.数码选品:先定用途,再比参数,拒绝 “加点钱更好” 的超支诱惑。
2.购车决策:看平台生命周期,算长期使用成本,刚需比潮流更重要。
3.重点提醒:多查真实评价,少信首发噱头,买得对远比买得新划算。
4.交流准则:聊产品讲实际体验,不抬杠不诋毁品牌,友善分享。
5.氛围维护:遇到分歧先理性沟通,不贴“粉黑”标签,温馨交流。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注QQ群
手机版|小黑屋|万狸社区-免费活跃数码论坛,手机/电脑/汽车+旅游美食游戏兴趣社区

相关侵权、举报、投诉及建议等,请发 E-mail:572109352@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|桂ICP备16003785号

在本版发帖
客服QQ:572109352
QQ客服返回顶部