smolagents 支持文本、视觉、视频和音频输入,通过模态无关(Modality-Agnostic)架构实现。Agent 可以将图像、音频和视频直接纳入代码生成和执行流程,处理多模态数据。
Hugging Face 社区推出了 smolagents-can-see 扩展库,为 Agent 提供视觉理解能力。这使得 Agent 可以处理网页截图、检测 UI 元素,并基于视觉输入生成相应的 Python 操作代码。在 GAIA 基准测试的标注数据集中,也包含了 PDF 和 Excel 文件的手动截图,以辅助基于视觉的推理。
多模态能力主要通过自定义工具实现。例如,可以定义一个图像分析工具,使用 PIL 处理图像并返回描述信息;或定义语音转写工具,将音频文件转换为文本。Agent 在代码中可以调用这些工具,对多模态输入进行分析、转换和综合处理。