首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >CrewAI >CrewAI 是否支持多模态输入输出?

CrewAI 是否支持多模态输入输出?

词条归属:CrewAI

1. 多模态文件输入支持

CrewAI 原生支持多种文件类型的输入处理,通过 crewai-files 包提供专门的类:

  • ImageFile:照片、截图、图表、示意图
  • PDFFile:文档、报告、论文
  • AudioFile:语音录音、播客、会议记录
  • VideoFile:屏幕录制、演示视频
  • TextFile:代码文件、日志、数据文件

文件可以通过本地路径、URL 或字节流三种方式传入,支持在 Crew、Task、Flow 和单独 Agent 四个层级传递,更具体的层级具有更高优先级。

2. 自动格式适配

CrewAI 自动根据 LLM 提供商的 API 要求格式化文件:

  • OpenAI:图像最大 20 MB,PDF 最大 32 MB,音频最大 25 MB
  • Anthropic:图像最大 5 MB,PDF 最大 32 MB
  • Google Gemini:图像最大 100 MB,PDF 最大 50 MB,音频最大 100 MB,视频最大 2 GB
  • AWS Bedrock:图像最大 4.5 MB,PDF 最大 3.75 MB

对于没有文件上传 API 的提供商,CrewAI 自动使用内联 base64 编码;当文件超过提供商限制时,支持 strict、auto、warn 和 chunk 等处理模式。

3. 在提示词中引用文件

开发者可以在任务描述中使用文件的键名引用文件,智能体会自动理解并处理:

代码语言:javascript
复制
task = Task(
    description="""
    分析提供的材料:
    1. 审查 {sales_chart} 中的图表
    2. 与 {quarterly_report} 中的数据进行交叉验证
    3. 总结主要发现
    """,
    input_files={
        "sales_chart": ImageFile(source="chart.png"),
        "quarterly_report": PDFFile(source="report.pdf"),
    }
)

4. 多模态能力的边界

需要注意的是,图像和 PDF 的端到端验证已经较为成熟,但音频、视频和文档目前可能通过图像通道路由,在严格模式下可能被某些提供商拒绝。原生按类型的映射仍是一个已知差距,而非完全发布的功能。

相关文章
请说明Java是否支持多继承?
Java中类不支持多继承,只支持单继承(即一个类只有一个父类)。但是java中的接口支持多继承,,即一个子接口可以有多个父接口。(接口的作用是用来扩展对象的功能,一个子接口继承多个父接口,说明子接口扩展了多个功能,当类实现接口时,类就扩展了相应的功能)。
剑走天涯
2019-09-02
1.4K0
PHP Neuron V3 正式全面支持多模态
通常纯 AI 音频服务不支持工具和对话等完整的代理能力。因此,您可以将这些组件作为独立服务在代理工作流程中使用,或者因为它们实现了 AIProviderInterface 接口,可以在代理内部使用。在这种情况下,您可以受益于代理工作流程功能,如中间件和护栏。
Tinywan
2026-07-01
1900
复旦等发布AnyGPT:任意模态输入输出,图像、音乐、文本、语音都支持
最近,OpenAI 的视频生成模型 Sora 爆火,生成式 AI 模型在多模态方面的能力再次引起广泛关注。
机器之心
2024-03-07
6540
Memfree:一个混合 AI 搜索引擎,输入输出支持多模态内容(知识库+联网 混合Rerank)
一个不错的AI搜索引擎,你可以通过文本、图像、文件和网页进行搜索和提问,他会输出文本、思维导图、图像和视频的搜索结果,比较和总结多个图像,以及总结网页和 PDF 内容并提问。
AI进修生
2024-12-02
5950
RAG系统如何支持多模态检索?图文检索如何实现?
🚀 本文收录于Github:AI-From-Zero 项目 —— 一个从零开始系统学习 AI 的知识库。如果觉得有帮助,欢迎 ⭐ Star 支持!
ETL 小当家
2026-03-25
8200
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券