首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏人工智能

    vLLM部署Qwen3:6B模型启动失败

    忘记安装gcc g++ python-dev等依赖库,执行下面命令安装相应依赖库后解决

    65711编辑于 2026-01-13
  • 昇腾推理Qwen3与DeepSeek R1 Distill性能实测

    以下为 Qwen3 32B 模型在双卡昇腾 910B 上的推理性能数据对比: 单并发 vLLM Ascend 对比 MindIE 6 并发 MindIE 性能数据 6 并发 vLLM Ascend 性能数据 中小模型单卡部署场景下,vLLM 在延迟和吞吐方面表现更优 以单卡部署的 DeepSeek R1 7B 和 Qwen3 14B 为例,vLLM 在 TTFT(首 token 延迟)方面普遍低于 MindIE

    38210编辑于 2026-06-22
  • 来自专栏TGLTommyAI前沿技术论文

    深度解读 Qwen3 Embedding:从基础模型到SOTA文本Embedding与Reranker

    这篇名为《Qwen3 Embedding》的技术报告,就像为我们揭开了一层面纱,让我们得以一窥Qwen3这个“大家族”如何在文本理解的基石——Embedding 和 Reranking 技术上再进一步, 一、Qwen3 Embedding 是什么?为什么重要? 为什么Qwen3 Embedding的出现如此引人注目? 随着Qwen3这样强大的基础模型(Foundation Models)的出现,它们在多语言文本理解和生成方面展现出了惊人的能力。 Qwen3 Embedding系列正是建立在Qwen3基础模型之上,旨在充分利用其强大的能力,解决现有技术的痛点。 二、核心亮点:Qwen3 Embedding 的“独门秘籍” 这篇论文介绍了Qwen3 Embedding系列模型的诸多创新之处,我们可以总结为以下几个核心亮点: 2.1 基于强大的Qwen3基础模型:

    31210编辑于 2026-06-25
  • 来自专栏机器学习与统计学

    大模型写高考作文,状元是DeepSeek,榜眼是Qwen3,探花是Gemini

    DeepSeek-R1、Kimi、Qwen-3-235B-A22B、豆包、Claude-3.7-sonnet、GPT-4.1、Gemini 2.5 Pro共同作答

    62810编辑于 2025-06-08
  • 来自专栏福大大架构师每日一题

    ollama v0.12.1 更新详解:新增 Qwen3 Embedding、云模型支持与多项功能修复

    本次更新不仅带来了全新的 Qwen3 Embedding 模型,还在工具调用、云模型交互、Linux 平台登录等方面进行了优化和修复,是一次功能与稳定性同步提升的重要版本。 二、核心更新内容 1. 新增模型 • Qwen3 Embedding 高性能的开源向量嵌入模型,由 Qwen 团队提供,适用于搜索、推荐、语义匹配等任务。 2. • 模型使用者:Qwen3 Embedding 将提升搜索与语义任务的精度,Harmony 工具支持可以在复杂任务中带来更高的可扩展性。 上线 Qwen3 Embedding 与云模型,让硬件门槛大幅降低; 2. Harmony 工具支持与思维链功能完善; 3.

    99210编辑于 2025-12-18
  • 来自专栏福大大架构师每日一题

    DeepSeek-V3、Qwen3 齐登场,AI 领域再迎巨变!

    不仅新增了 Meta 的 Llama 4、微软的 Phi4-Multimodal、深度求索的 DeepSeek-V3 以及 Qwen3 四大重量级模型,还优化了多项功能,修复了诸多 Bug,让 AI 开发者们直呼 Qwen3:阿里通义千问最新架构,即将发布 5. 其他重要改进与 Bug 修复 如果你是 AI 开发者、研究人员,或者对前沿 AI 技术感兴趣,这篇文章绝对不容错过! 1. Qwen3:阿里通义千问最新架构 虽然 Qwen3 的模型尚未正式发布,但 Transformers v4.51.0 已支持其架构,预计阿里很快会推出新版本。 • Llama 4 带来更强大的多模态 MoE 模型 • Phi4-Multimodal 让轻量级多模态 AI 触手可及 • DeepSeek-V3 以低成本实现顶级性能 • Qwen3 蓄势待发,或将再次刷新中文

    2K30编辑于 2025-04-07
  • 来自专栏编程语言的世界

    vLLM 部署 Qwen3-VL-32B-Thinking 模型 reasoning_content 为空问题解决记录

    作为参数值--reasoning-parser qwen3第二步:排查推理内容分离问题通过测试发现:✅ 模型正常生成推理内容✅ <think>... reasoning_content 字段仍为 null第三步:发现根本原因关键发现:Qwen3-VL-32B-Thinking 模型的输出格式实际上遵循 DeepSeek-R1 格式,而不是标准的 Qwen3 正如文档所述:Qwen3-Thinking-2507 不输出 <think> 起始标记,导致 Qwen3 推理解析器无法解析它,因为它符合 DeepSeek-R1 格式。 推理功能特性默认启用:Qwen3 系列模型的推理功能默认处于启用状态禁用方法:如需禁用,在 API 请求中传入 enable_thinking=False格式兼容性:Qwen3-VL-32B-Thinking 使用 DeepSeek-R1 格式而非标准 Qwen3 格式3.

    5.6K40编辑于 2025-10-28
  • 来自专栏福大大架构师每日一题

    ollama v0.32.4 发布:Laguna 登陆 Apple GPU,Qwen3 MoE 解码修复与 Agent 技能权限全面升级

    本次版本围绕 Apple GPU 推理支持、投机解码草稿模型量化、Qwen3 MoE 解码兼容性和性能优化,以及 Agent 技能加载的权限控制展开更新。 五、Qwen3 MoE 解码修复:不同量化专家不再按单一格式处理 本次版本另一项核心更新,是 Qwen3 MoE 解码修复。 这项改动直接指向 Qwen3 MoE 模型中的专家张量处理逻辑。 对于包含不同量化专家张量的 Qwen3 MoE 模型,解码路径将不再假设所有专家采用相同格式。 六、Qwen3 MoE 性能优化:打包 gate/up 专家合并为一次启动 除了不同量化专家的解码修复,v0.32.4 还对 Qwen3 相关的专家投影执行路径进行了优化。

    300编辑于 2026-07-27
  • WorkBuddy 完全指南:配置本地 Ollama 模型,实现离线零积分使用

    bash复制ollama --version看到版本号输出,说明安装成功 ✅三、下载本地模型Ollama 支持拉取各种开源大模型,以下是我亲测适合不同配置的选项:模型选择建议模型内存占用推荐配置中文能力qwen3 :4b~2.5GB8GB 内存 ✅⭐⭐⭐⭐⭐ 最佳qwen3:8b~5GB16GB 内存 ✅⭐⭐⭐⭐⭐ 最佳llama3.2:3b~2GB8GB 内存 ✅⭐⭐⭐ 一般phi3:3.8b~2.3GB8GB 内存 ✅⭐⭐⭐ 一般推荐:中文用户首选 qwen3:4b(通义千问),中文理解能力最强! 拉取模型命令在命令行运行(以 qwen3:4b 为例):bash复制ollama pull qwen3:4b拉取完成后,测试一下:bash复制ollama run qwen3:4b "你好,介绍一下你自己 :4b(与你拉取的模型名一致)点击 保存步骤 3:切换使用配置完成后,在 WorkBuddy 对话界面的模型选择器中,选择你配置的 qwen3:4b (Ollama),即可开始离线对话!

    5.4K00编辑于 2026-06-06
  • 来自专栏福大大架构师每日一题

    ollama v0.12.2 版本更新详解:Qwen3 架构支持、Multi-Regex 分词器、新引擎前后缀匹配等功能升级

    该版本不仅提升了对 Qwen3 架构(包括 MoE 混合专家模型)的运行支持,还在分词器、内置工具渲染、张量加载等方面做出重大调整。本文将详细解析本次更新的技术细节和影响。 一、核心更新摘要 1. Qwen3 架构模型(含 MoE)切换到 Ollama 新引擎运行 • 新引擎更好地支持 Qwen3 系列权重加载与推理,包括 Qwen3-MoE(混合专家)模型。 为了适配 Multi-Regex 方案和新引擎,本次更新重构了多个模型的加载方法,包括: • llama / llama4 系列 • mistral3 • mllama • qwen2、qwen25vl、qwen3 对推理系统维护者: • 新引擎对 Qwen3 MoE 支持,意味着可以在 Ollama 中稳定部署混合专家模型。 • 内置工具不重命名修正,提升与工具 API 对接的稳定性。 七、总结 ollama v0.12.2 是一次针对核心引擎、分词器、模型加载逻辑的全面升级,尤其是: • 新引擎全面支持 Qwen3 MoE • 多 Regex 分词器 • Tag 前后缀功能 • 内置工具渲染修复

    69810编辑于 2025-12-18
  • 来自专栏福大大架构师每日一题

    lmdeploy v0.8.0发布!多项核心功能升级,性能爆表,打造AI部署新时代!

    Qwen3系列全新支持 • 新增Qwen3及Qwen3MoE模型支持,由@lzhangzz和@CUHKSZxy推动,涵盖PyTorch引擎的全流程兼容,助力更丰富、更高效自然语言处理应用。 • Qwen3 fp8低精度支持,大幅降低计算资源需求同时确保精度。 • 支持Qwen3的AWQ量化,带来轻量化推理新选择。 • MoE门控优化,提升模型专家路由效率。 3. 快速体验Qwen3模型部署 from lmdeploy import LMEngine engine = LMEngine(model_name='Qwen3', device='cuda') response 详细教程及示例可查阅官方文档:https://lmdeploy.internlm.ai/docs 七、总结 InternLM lmdeploy v0.8.0版本带来: • 多设备、多节点并行推理支持 • Qwen3

    80210编辑于 2025-05-05
  • 来自专栏机器之心

    从GPT-2到gpt-oss,深度详解OpenAI开放模型的进化之路

    下图对比了 gpt-oss-20B 与大小相当的 Qwen3 模型。 图 13:大小相当的 gpt-oss 和 Qwen3 模型。 可以看到,gpt-oss 20B 和 Qwen3 30B-A3B 在架构组件上非常相似。除了尺寸之外,主要区别在于 gpt-oss 采用了滑动窗口注意力,而 Qwen3 则没有。 例如,在查看多种尺寸的 Qwen3 MoE 模型(下图 17)时,它们在更多方面彼此之间进行了更均衡的缩放。 图 17:各种 Qwen3 模型的架构差异。 遗憾的是,目前尚无关于 Qwen3 训练时间的信息。 「no tools」的 gpt-oss-120b 数据取自官方模型卡,Qwen3 数据取自官方 Qwen3 代码库。

    67210编辑于 2025-08-24
  • 来自专栏nobody

    Ollama大模型入门指南

    前提条件 在开始之前,请确保你已经安装Ollama并下载qwen3:4b模型: 代码解析 import asyncio from ollama import AsyncClient # 创建异步客户端 content': '你好,如何入门大模型学习'} # 发起流式聊天请求 asyncfor part inawait client.chat( model='qwen3 ://localhost:11434,如果修改了端口需在此指定 llm = ChatOllama( base_url="http://localhost:11434", model="qwen3 ://localhost:11434,如果修改了端口需在此指定 llm = ChatOllama( base_url="http://localhost:11434", model="qwen3

    36610编辑于 2026-03-16
  • 来自专栏精益码农

    还有比ollama更傻瓜式的大模型本地部署方式吗 ?

    :8b 500a1f067a9f 5.2 GB 23 hours ago ## size 是预估的显存大小 qwen3:8b vs qwen3- 下载完ollama, 选择qwen3:8b大模型,开始下载模型。 1. ollama run qwen3:8b $ ollama run qwen3:8b >>> Send a message (/? curl http://localhost:11434/api/chat -d '{ "model": "qwen3:8b", "messages": [{ "role": "user" }], "stream": false }' {"model":"qwen3:8b","created_at":"2026-01-21T07:57:52.9621534Z","message":{"

    1.4K10编辑于 2026-01-27
  • 来自专栏架构进阶

    实测|Mac本地Claude Code,4大热门模型(minimax/qwen/kimi/glm)对比

    在自己的MacBook Pro(M4芯片,24GB内存)上,完成了基于Ollama安装Claude Code的全流程验证,并且选取了目前使用频率较高的4个模型——minimax-m2.5:cloud、qwen3 3.2 可选模型 Ollama支持本地模型和云端模型的拉取,其中qwen3:8b、glm-4.7-flash是本地模型(需要下载模型文件到本地),minimax-m2.5:cloud、kimi-k2.5 如果是新手入门、基础编码、离线使用、预算有限,优先选qwen3:8b:轻量化易部署,无使用成本,基础需求完全满足,适合学生、新手开发者,断网环境也能使用。 5.2 按人群选择 新手/学生:qwen3:8b(易上手、无成本、基础需求满足)→ 进阶后可切换到glm-4.7-flash(本地)或minimax-m2.5:cloud(云端)。 网络不稳定/数据隐私要求高:glm-4.7-flash(本地、高效)、qwen3:8b(本地、轻量化),优先选glm-4.7-flash(性能更优)。

    3.1K31编辑于 2026-05-06
  • 来自专栏机器学习与统计学

    你的电脑能不能跑大模型?这个本地测评神器,直接给答案

    调用是否高效、有没有乱编工具、要求调用的工具有没有都调用到 这比单纯跑一个 tok/s 有用多了 看榜单 我看官方 leaderboard 的公开 API 时,已经有 126 条提交 前排数据大概长这样: qwen3 使用 先确保你本地有模型服务在跑 Ollama 最简单: ollama pull qwen3:8b ollama serve 然后跑一遍默认 benchmark: benchloop run \ Jan 的 1337 我个人还是建议把 --provider 写清楚,排查问题时省心 LM Studio 这类 OpenAI 兼容服务可以这样跑: benchloop run \ --model qwen3 :8b --harness raw benchloop run --model qwen3:8b --harness hermes benchloop run --model qwen3:8b --harness qwen benchloop run --model qwen3:8b --harness pi 大概可以这样理解: raw:原生工具调用 hermes:<tool_call>{...}

    50210编辑于 2026-05-19
  • 来自专栏福大大架构师每日一题

    DeepSpeed v0.16.6震撼发布!性能优化+BUG修复全解析,AI训练再提速!

    新功能支持:Qwen3自动张量并行(AutoTP)支持,复杂场景下的TiedLayerSpec兼容性增强! 4. 兼容性升级:适配PyTorch最新梯度钩子API,修复HPU内存映射问题。 新功能支持 • Qwen3自动张量并行(AutoTP)支持 新增对Qwen3模型的自动张量并行优化,简化大模型训练配置。

    88510编辑于 2025-04-18
  • 探索HTTP流式返回:Python实战与Ollama本地模型测试

    例如,拉取一个较小的模型如 phi 或 qwen3:1.7b 以便快速测试: ollama pull qwen3:1.7b 运行模型(Ollama服务会自动加载): Ollama服务启动后,它会自动处理模型的加载和运行 :1.7b\", \"prompt\":\"给michael阿明讲个笑话\", \"stream\":true}' {"model":"qwen3:1.7b","created_at":"2025-05 -16T14:29:42.259136Z","response":"\u003cthink\u003e","done":false} {"model":"qwen3:1.7b","created_at" ":"让我","done":false} {"model":"qwen3:1.7b","created_at":"2025-05-16T14:29:42.6310473Z","response":"给" ,"done":false} {"model":"qwen3:1.7b","created_at":"2025-05-16T14:29:42.6935324Z","response":"Michael"

    41010编辑于 2026-03-25
  • 来自专栏机器学习与统计学

    大模型 LLM 架构对比,DeepSeek、Llama、Qwen、Kimi、Mistral、Gemma

    图 18:Qwen3 0.6B 与 Llama 3 1B 的架构比较;注意 Qwen3 是更深的架构,层数更多,而 Llama 3 是更宽的架构,注意力头更多。 如果您对不依赖外部第三方 LLM 库的 Qwen3 可读实现感兴趣,我最近用纯 PyTorch 从头实现了 Qwen3。 6.2 Qwen3(MoE) 如前所述,Qwen3 还有两种 MoE 变体:30B-A3B 和 235B-A22B。为什么像 Qwen3 这样的架构同时提供密集和 MoE(稀疏)变体? 图 19:DeepSeek-V3 与 Qwen3 235B-A22B 的架构比较。 如上图所示,DeepSeek-V3 和 Qwen3 235B-A22B 的架构非常相似。 值得注意的是,Qwen3 模型放弃了共享专家(早期 Qwen 模型如 Qwen2.5-MoE 使用了共享专家)。 遗憾的是,Qwen3 团队未披露为何放弃共享专家的原因。

    4.4K10编辑于 2025-08-05
  • 来自专栏猫头虎博客专区

    DeepSeek R1 模型小版本升级,DeepSeek-R1-0528都更新了哪些新特性?

    数学:AIME‑2025 87.5 %(国产第一,逼近 o3/Gemini‑2.5‑Pro) 代码:HumanEval‑Plus 91 % 综合逻辑:MMLU 87.2 此外,官方将思考链蒸馏到 Qwen3 ‑8B,得到 DeepSeek‑R1‑0528‑Qwen3‑8B,在 AIME‑2024 仅次于原版 R1‑0528,超过 Qwen3‑8B (+10 %),逼平 Qwen3‑235B。

    2.3K10编辑于 2025-05-31
领券