首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >smolagents >smolagents 支持哪些大语言模型和推理后端?

smolagents 支持哪些大语言模型和推理后端?

词条归属:smolagents

1. 模型无关设计

smolagents 采用模型无关(Model-Agnostic)架构,model 参数接受任何符合消息列表到响应映射接口的对象。内置适配器覆盖主流推理后端:

适配器类

后端类型

安装方式

InferenceClientModel

Hugging Face Inference Providers(Together、Fireworks 等)

核心库内置

LiteLLMModel

100+ 提供商(OpenAI、Anthropic、Bedrock 等)

pip install 'smolagents[litellm]'

TransformersModel

本地 transformers 流水线

pip install 'smolagents[transformers]'

OpenAIServerModel

任意 OpenAI 兼容端点

核心库内置

MLXModel

Apple Silicon 本地推理

pip install 'smolagents[mlx-lm]'

VLLMModel

本地 vLLM 服务器

pip install 'smolagents[vllm]'

2. 本地模型部署

对于希望在本地运行模型的场景,可通过 Ollama 或 vLLM 提供服务,然后将 LiteLLMModelOpenAIServerModel 指向本地端点(如 http://localhost:11434)。这使得 Agent 可以在完全离线、数据不出网络的环境中运行。

3. 模型切换的便利性

更换模型仅需修改一行代码,Agent 的业务逻辑和工具配置保持不变。这种设计避免了被单一供应商锁定,开发者可根据成本、延迟和性能需求灵活选择模型。

相关文章
大语言模型推理框架调研
大语言模型(LLM)的迅猛发展及其在自然语言处理、代码生成、多模态交互等领域的广泛应用,对底层推理基础设施提出了前所未有的挑战。模型规模的急剧膨胀(参数量从数十亿扩展至数万亿)和复杂计算需求(如注意力机制)导致推理过程中的显存占用巨大、计算延迟高昂。为了在实际生产环境中高效、经济地部署 LLM,业界涌现出一系列专门针对 LLM 推理优化的框架。这些框架通过引入创新的内存管理机制、批处理策略、并行计算技术以及硬件加速等手段,旨在提升推理吞吐量、降低延迟、优化资源利用率。
磊叔的技术博客
2025-06-03
4.9K0
大语言模型推理优化论文-EdgeMoE
代码仓库:https://github.com/UbiquitousLearning/mllm
aaronwjzhao
2025-07-18
7340
使用vLLM加速大语言模型推理
vLLM 是一个快速且易于使用的库,用于 LLM 推理和服务,和 HuggingFace 无缝集成。区别于 chatglm.cpp 和 llama.cpp,仅是在 GPU 上的模型推理加速,没有 CPU 上的加速。
码之有理
2023-09-12
24.5K0
大语言模型推理优化论文-Reasoning on a Budget
这篇论文主要讨论了如何提高大型语言模型(LLMs)在推理时的计算效率。目前的LLMs在推理时往往采用固定的计算预算,导致对于简单问题过度思考,而对于复杂问题则不足思考。为了改善这种情况,作者提出了适应性和可控性两种策略,并对这两种策略进行了详细的介绍和比较。通过在多个数据集上进行测试,作者还探讨了这些策略之间的关键权衡,并指出了未来需要解决的关键挑战。总体来说,本文为提高LLMs的计算效率提供了有价值的参考。
aaronwjzhao
2025-07-18
7110
大语言模型与归纳推理的艺术
大语言模型(LLMs)的涌现能力随着规模扩大而不断提升;当规模增长时,LLMs将走向何方?从Ray Solomonoff的归纳理论和随机实现理论中获得的见解,可能帮助我们构想并指导规模扩展的极限。
用户11764306
2025-09-07
3850
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券