首页
学习
活动
专区
圈层
工具
发布

DeepSeek上线多模态视觉理解模型

IT时代网8月21日消息,深度求索官方宣布全新的多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 在 API 平台上线。该模型支持在文本之外输入图片,可描述图片内容、识别截图中的文字、分析图表等,支持的图片格式包括 JPEG、PNG、GIF、WebP。

官方表示,这款实验性质模型在各类 Agent 框架内展现出较好的多模态适配能力。在纯文本能力上与正式版持平,而在需要视觉理解的 Agent 基准测试上相比原版实现大幅跃升,多模态 Agent 能力已接近 Opus-4.8。

调用时设置对应的 model 参数即可访问。图片会转换为 token 后按 token 计费,单张图片最多占用 384 个 token,计费价格与原模型一致。多模态 API 支持 Chat Completions、Messages、Responses 三种格式,可接入各类 Agent 工具,支持图文混合输入,以及 base64 内联、在线地址与文件接口三种图片传入方式。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/O02zyPIxR5MgSHMd38GVV1wA0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券