首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏开源项目搭建

    简单3步部署本地国产大模型DeepSeek大模型

    简单3步部署本地国产大模型DeepSeek大模型DeepSeek是最近非常火的开源大模型,国产大模型 DeepSeek 凭借其优异的性能和对硬件资源的友好性,受到了众多开发者的关注。 本文将介绍如何通过简单 3 步在本地部署 DeepSeek 大模型,让你能够轻松体验这一强大的 AI 工具。 GeForce RTX 4070Ti可以运行大模型deepseek-r1的哪个版本的大模型? 提供了类似OpenAI的API接口和聊天界面,可以非常方便地部署最新版本的GPT模型并通过接口使用。支持热加载模型文件,无需重新启动即可切换不同的模型。 ,可以根据需要选择不同版本,例如 ollama run deepseek-r1:671b,详情如下(模型参数越大,需要配置越高):在DeepSeek-R1系列中,还有1.5B、7B、8B、14B、32B

    7.1K33编辑于 2025-02-06
  • 来自专栏机器学习与统计学

    纯离线安装大模型推理引擎,部署量化大模型

    大家好,我是 Ai 学习的老章 继续介绍大模型推理引擎+Llama.cpp,前文我写了# 内网部署 llama.cpp,运行量化大模型,详细介绍了 llama.cpp 这个推理引擎,内网离线 cmake 本文我们用个更省事儿的内网离线部署方式——Docker,然后用其部署量化大模型,其中踩坑若干,才有如此精炼、极简教程 1、联网环境拉取 llama.cpp 镜像并保存 选择镜像最好是官方,比如 llama.cpp server-cuda https://github.com/ggml-org/llama.cpp/blob/master/docs/docker.md 市面上有很多个人打包的镜像,大多都是阉割版 费老大劲搞进去,发现大模型无法加载 /dir 再传入内网: llama.cpp 服务需要模型文件才能运行,在你的 Linux 服务器上创建一个目录,用来存放 GGUF 格式的模型文件。 5、启动大模型 docker run --rm --runtime nvidia -e TZAsia/Shanghai --gpus "device=2" -v /opt/data/ai/GGUF:/models

    2.7K10编辑于 2025-10-11
  • 来自专栏AllTests软件测试

    本地部署AI大模型DeepSeek

    DeepSeek是一家专注于人工智能技术的公司(中国杭州深度求索)及其推出的大语言模型的名称。 DeepSeek的核心产品,是一系列强大的大语言模型。 官方网址: https://www.deepseek.com/ 本篇讲解如何快速的在本地部署AI大模型DeepSeek。 2、本地部署DeepSeek 1、首先要下载安装Ollama。 Ollama是一个开源的大型语言模型本地部署框架。 特点: 多平台支持,如Windows、macOS、Linux,还支持Docker,方便跨平台部署。 它支持多种大语言模型运行程序,如Ollama和兼容OpenAI的应用程序编程接口(API),还内置了用于检索增强生成(RAG)的推理引擎,使其成为一个强大的人工智能部署解决方案。

    1K11编辑于 2025-02-10
  • 来自专栏小陈运维

    使用Ollama部署deepseek大模型

    使用Ollama部署deepseek大模型 前置条件 使用英伟达显卡下载cuda驱动 https://developer.nvidia.com/cuda-downloads Ollama Ollama 的安装方式去安装 若你的显卡是在Linux上面 可以使用如下命令安装 curl -fsSL https://ollama.com/install.sh | sh 当然Ollama不只是可以启动deepseek模型 ,也可以启动他的模型 https://ollama.com/search # 模型的安装命令 # 1.5B Qwen DeepSeek R1 # 所需空间大约 1.1G ollama run deepseek-r1 :1.5b # 7B Qwen DeepSeek R1 # 所需空间大约 4.7G ollama run deepseek-r1:7b # 8B Llama DeepSeek R1 # 所需空间大约 4.9G ollama run deepseek-r1:8b # 14B Qwen DeepSeek R1 # 所需空间大约 9G ollama run deepseek-r1:14b # 32B

    3K20编辑于 2025-02-04
  • 来自专栏小陈运维

    使用Ollama部署deepseek大模型

    使用Ollama部署deepseek大模型前置条件使用英伟达显卡下载cuda驱动https://developer.nvidia.com/cuda-downloadsOllamaOllama 官方版: 的安装方式去安装若你的显卡是在Linux上面 可以使用如下命令安装curl -fsSL https://ollama.com/install.sh | sh当然Ollama不只是可以启动deepseek模型 ,也可以启动他的模型https://ollama.com/search# 模型的安装命令# 1.5B Qwen DeepSeek R1 # 所需空间大约 1.1Gollama run deepseek-r1 :1.5b# 7B Qwen DeepSeek R1# 所需空间大约 4.7Gollama run deepseek-r1:7b# 8B Llama DeepSeek R1# 所需空间大约 4.9Gollama run deepseek-r1:8b# 14B Qwen DeepSeek R1# 所需空间大约 9Gollama run deepseek-r1:14b# 32B Qwen DeepSeek R1#

    3.7K12编辑于 2025-01-26
  • 来自专栏数据挖掘

    大模型高效下载部署方式

    下载模型sh hfd.sh gpt2 --tool aria2c -x 44.下载数据集sh hfd.sh wikitext --dataset --tool aria2c -x 4 二、国内魔塔社区下载下面以 cogvlm2-llama3-chinese-chat-19B 为例子SDK下载#模型下载from modelscope import snapshot_downloadmodel_dir = snapshot_download

    96010编辑于 2024-07-15
  • 来自专栏.Net Core技术分享

    Ollama本地部署大模型总结

    今天计划对之前ollama系列做个回顾,从如何部署到API使用,整理到一篇内容中,提供给大家参考。 ollama run deepseek-r1:1.5b 下载完成后,ollama会为我们运行刚下载的大模型。下面是我运行成功的截图: 第三步:使用大模型 恭喜你已经在本地成功安装了第一个私有大模型。 Token:字符块,是大模型的最小输出单位,同时也是大模型的计费单位。 举个例子,对于天空为什么是蓝色的这句话,大模型会进行拆分天空/为什么/是/蓝色/的,每一段就是一个token(实际情况会比这个例子复杂) 内容生成(/api/generate) 让大模型帮我们生成指定的内容 在内容生成API中,我们仅传入了prompt,大模型仅对我们本地的prompt进行回答,而在生成对话API中,我们还可以传入messages参数,包含我们多轮对话内容,使大模型具备记忆功能。

    5.9K11编辑于 2025-03-30
  • 来自专栏Lcry个人博客

    无限白嫖高性能8H32G云GPU部署大模型

    今天给大家介绍一个白嫖的GPU服务器,每个月免费50000时长,分配的是一台16GB显存、8 + TFlops SP、8核CPU、内存32G的一台ubuntu20.04的机器,提供在线IDE进行终端操作 ,可以用来部署大模型服务,运行ollma、dify、chatglm等等,以及开发调试训练一些模型等等,纯纯免费,可以开多台机器,反正每个月5w分钟时长,用完才付费,大家可以拿来玩玩部署下大模型。 ----------- CPU架构: x86_64 CPU型号: Intel(R) Xeon(R) Platinum 8255C CPU @ 2.50GHz CPU核心数: 8 5、如果你需要部署一些服务,可以选择使用内网穿透等工具直接暴露出来,我目前使用ollma了qwen2:7b模型然后对接one-api,推理非常的丝滑,需要的话可以查看我前面写的这个文章《使用 Ollama 自建大模型并对接第三方平台二次分发盈利》,下面看我的效果。

    5.5K20编辑于 2024-11-22
  • 来自专栏GiantPandaCV

    大模型部署框架 FastLLM 简要解析

    前言 本文主要是对FastLLM做了一个简要介绍,展示了一下FastLLM的部署效果。 /quant -p chatglm-6b-fp32.flm -o chatglm-6b-int8.flm -b 8 #导出int8模型 . 要在FastLLM中自定义一个模型,需要实现的核心部分就是这个模型文件了,从目前FastLLM提供的组件来看,基于Transformer架构的开源大模型支持的难度和工作量会比较小,而对于新的架构比如RWKV 比较期待FastLLM推出ONNX的支持,这样就可以更方便的和各种类型的大模型对接起来。 0x4. 总结 本文主要是对FastLLM做了一个简要介绍,展示了一下FastLLM的部署效果。

    1.6K20编辑于 2023-08-22
  • 来自专栏陈冠男的游戏人生

    使用ollama本地部署开源大模型

    chatGPT 刚出来没多久的时候,openai 时不时的限制使用频率,当时我想要是能本地部署一个大模型,无限制的使用该多好哇。 后来有很多团队/公司陆陆续续在 github 开源了他们自己训练的大模型,但是部署使用的操作门槛比较高,曾经试图部署过一个,报了几个错也没时间折腾就放弃了 前几天我发现了一个叫 ollama 的项目,根据介绍 ,一条命令就能跑起来一个大模型,因此实际体验了一下,项目地址: https://github.com/ollama/ollama 先说一下使用体验,极其丝滑,完全没有报错,感觉就像是刚开始学 web 安全 ,此时就已经部署结束了 可以在:https://ollama.com/library 找到更多的模型 但是在命令行中直接交互里很多格式解析不出来,看起来怪怪的,可以使用 chatbot-ollama 这个项目部署一个 webUI,这样就可以在聊天框里面调用模型对话了,项目地址: https://github.com/ivanfioravanti/chatbot-ollama 这个项目部署起来也很简单,只要电脑上装有

    3.3K20编辑于 2024-03-05
  • 来自专栏微言码道

    本地部署大模型的几种方式

    这之中当然有诸如GhatGPT, Gemini这样的私有化大模型, 更吸引人关注的可能是开源的可私有化部署的一些大模型. 相对而言, 一些开源的可私有化部署的大模型, 可能更令人关注. 因为只要有足够的硬件资源, 你就能私有化部署这些大模型. 今天我就介绍几种常见的, 方便的私有化大模型的方式, 这些方式都是开源或免费的. 私有化部署方式 Ollama 要说私有化部署大模型最方便的方式, 我认为非Ollama莫属了. 就算仅仅是个人使用, 如果你是M1或以上的芯片, 或有类似4090消费级显卡, 在本地运行一个llama 3 8B或Gemma 7B这样的开源模型, 是非常方便, 响应速度也比较快. 总结 开源大模型, 或者说本地化运行一个开源大模型, 现在已经越发的简单与低门槛了. 只要有足够的GPU硬件, 本地化部署与运行开源大模型非常简单及易于实现. 想部署一个本地大模型玩玩?

    9.1K21编辑于 2024-04-23
  • 来自专栏云原生知识宇宙

    在 TKE 上部署 AI 大模型

    概述本文介绍如何在 TKE 上部署 AI 大模型,以 DeepSeek-R1 为例,使用 Ollama、vLLM 或 SGLang 运行大模型并暴露 API,然后使用 OpenWebUI 提供交互界面。 是一个运行大模型的工具,可以看成是大模型领域的 Docker,可以下载所需的大模型并暴露 Ollama API,极大的简化了大模型的部署。 vLLM 的特点:推理性能更好,也更节约资源,适合部署到服务器供多人使用,还支持多机多卡分布式部署,上限更高,但能适配的 GPU 硬件比 Ollama 少,且需要根据不同 GPU 和大模型来调整 vllm 选型建议:如果有一定的技术能力且愿意折腾,能用 vLLM 或 SGLang 成功跑起来更推荐用 vLLM 和 SGLang 将大模型部署到 Kubernetes 中,否则就用 Ollama ,两种方式在本文中都有相应的部署示例 AI 大模型数据如何存储?

    1.6K01编辑于 2025-02-20
  • 来自专栏AI智能体开发

    AI大模型本地化部署

    AI大模型本地化部署是将大规模人工智能模型(如GPT、LLaMA、DeepSeek等)部署到本地服务器或设备上,以满足数据隐私、安全性和性能需求的过程。 以下是AI大模型本地化部署的关键步骤、技术难点及解决方案。一、本地化部署的关键步骤1.需求分析与规划 明确应用场景(如智能客服、文本生成、图像识别等)。评估本地硬件资源(GPU、内存、存储)和预算。 二、技术难点及解决方案1.计算资源需求高难点:大模型需要高性能GPU和大量内存。解决方案:使用模型压缩技术(如量化、剪枝)和分布式计算。2.模型优化与效率难点:大模型推理速度慢,资源利用率低。 国产化适配:国产AI算力和模型(如DeepSeek)将加速普及。边缘计算:大模型将更多部署到边缘设备,满足实时性需求。 通过以上步骤和解决方案,AI大模型本地化部署可以更好地满足行业需求,推动AI技术的广泛应用。

    6K10编辑于 2025-03-08
  • 来自专栏素质云笔记

    大模型时代的模型运维与部署:LLMops

    这意味着 LLMOps 是一组工具和最佳实践,用于管理 LLM 支持的应用程序的生命周期,包括开发、部署和维护。 LLM(大型语言模型)是可以生成人类语言输出的深度学习模型(因此称为语言模型)。 2 LLMOps实现步骤 几个LLMops的步骤: 基础模型的选择 迭代和提示Prompt管理 测试 部署 监控 持续改进和微调 2.1 数据管理 2.1.1 数据清洗和预处理技术 原始数据可能存在噪声和结构混乱 测试和训练数据分布差异大:实际使用的数据分布总是不同于训练数据的分布。 难以用一个核心指标去衡量:指标不那么直接,可能无法捕捉模型的不同行为。语言模型需要对行为和定性输出测量有更多样化的理解。 2.5 部署 部署LLM(语言模型)API可能很简单,但是如果API调用背后有很多逻辑,则会变得更加复杂。 提高LLM输出质量的技术包括自我评价、采样多个输出和集成技术。 ---- 3 参考文献 LLMOps(Large Language Model Operations)简介 了解一下新领域 LLMOps: 大模型运维 LLM训练营课程笔记之 LLMOps: Deployment

    8K21编辑于 2023-07-09
  • 来自专栏AI智韵

    【大模型部署实战】VLLM+OpenWebUI实现DeepSeek模型部署,文末有福利

    摘要 vLLM(Very Large Language Model Serving)是由加州大学伯克利分校团队开发的高性能、低延迟大语言模型(LLM)推理和服务框架。 该框架支持连续批处理、动态显存分配和多GPU并行推理,能够高效处理8k+长上下文请求,并兼容OpenAI API接口,开发者可快速部署Hugging Face模型。 通过集成FP8、AWQ等量化技术,vLLM在保证推理精度的同时大幅降低资源消耗,目前已成为企业级AI部署(如DeepSeek-R1 671B模型分布式集群)的首选方案。 多 LoRA 微调支持 同时部署基础模型的多个微调版本,提升资源利用率7,9。 VLLM部署 有两种部署方法,第一种使用vllm serve,我们使用1.5B的模型举例,执行命令: vllm serve deepseek/DeepSeek-R1-Distill-Qwen-1.5B

    3.6K11编辑于 2025-03-17
  • 来自专栏Java技术进阶

    基于LMDeploy部署大模型和量化

    背景 大模型具有庞大的参数量,内存开销大,7B模型仅权重就需要14+G内存,采用自回归生成token,需要缓存Attention 的k/v带来巨大的内存开销;动态shape,请求参数不固定,Token逐个生成 ,且数量不定,因此在部署上都存在一些挑战。 LMDeploy介绍 LMDeploy 是LLM在英伟达设备上部署的全流程解决方案。包括模型轻量化、推理和服务。 接下来,我们看一下lmdeploy提供的部署功能。 2.1 模型转换 使用 TurboMind 推理模型需要先将模型转化为 TurboMind 的格式,目前支持在线转换和离线转换两种形式。 我想直接在自己的 Python 项目中使用大模型功能。推荐使用 TurboMind推理 + Python(2.5)。 我想在自己的其他非 Python 项目中使用大模型功能。

    3K00编辑于 2024-03-01
  • 来自专栏Python与算法之美

    Ollama 本地CPU部署开源大模型

    Ollama可以在本地CPU非常方便地部署许多开源的大模型。 如 Facebook的llama3, 谷歌的gemma, 微软的phi3,阿里的qwen2 等模型。 ollama run qwen2 #跑qwen2模型,如果本地没有,会先下载 ollama pull llama3 #下载llama3模型到本地 ollama list #查看本地有哪些模型可用 ollama rm #删除本地的某个模型 ollama help #获取帮助 ! 二, 命令行交互 可以在命令行中用 ollama run qwen2 运行一个模型,然后在命令行中和它对话。 下面的gif动画没有做任何加速。 这个回复速度还是非常的感人的~ 三,Python接口交互 在命令行运行 诸如 ollama run qwen2,实际上就会在后台起了一个qwen2的模型服务。

    4.3K11编辑于 2024-06-26
  • 来自专栏agent平台

    荒天帝炼大模型网关-第8境-真一境-真龙宝术-模型部署归一

    到这一境,任务是:把客户端看到的模型名和上游真实模型彻底解耦——客户端说coding-fast,网关自己决定这次到底打给谁。一开始我觉得这事不难,加一张别名映射表就完了。 客户端模型名到底该由谁定义——让客户端填一个上游模型名,还是由网关给出一个稳定契约?换上游Provider的时候,为什么不该动客户端的任何一行配置——这是洁癖,还是硬需求? Key要轮换,BaseURL会因为专线、代理层或者多区域部署而调整。这些是运维动作,不该触发客户端发版。第三,价格会调。调完之后,上个月已经出账的费用不能跟着变。 代价:一次请求从查一行变成解析、选择、装载三步,虽然都可以缓存,但缓存失效策略本身又是新的复杂度;另外deployment的权重、优先级、健康状态需要有人维护,配置面比原来大。 别名定契约部署管供给通道只承载三层各安位05、实战一次环境与依赖:JDK17SpringBoot3.2.x(Web、DataJPA、Validation)Flyway(数据库版本化)H2(本地)或MySQL8

    14021编辑于 2026-09-29
  • AGX Orin部署大语言模型实战教程

    AGX Orin部署大语言模型说明1. 环境搭建① 部署过程中需要安装各种工具及下载大语言模型,确保AGX Orin 已经连接到了互联网。查看方法:控制台ping baidu.com。 安装ollama并运行Ollama 是一个开源、跨平台的本地大语言模型(LLM)运行工具。 安装并运行大模型① 安装并运行大模型sudo docker exec -it ollama ollama run deepseek-r1:7b8.实战硬件介绍板卡特性SOCl SOC:Xilinx XCZU19EG-FFVC1760l Ø 32GB: Up to 200 Sparse TOPS (INT8)l 接口:Ø 网络:1路 1000BASE-TØ 调试:1路 UART(TYPE-C)Ø 显示:1路 DisplayPortØ USB:2路 USB3.2Ø M.2:1路PCIe4.0 x4Ø 互联:1路PCIe3.0 x8Ø 低速接口:2路CANl 物理与电气特性Ø 板卡尺寸:267mm x 230mmØ 板卡供电:+12V

    11410编辑于 2026-09-29
  • 来自专栏全栈开发日记

    本地部署DeepSeek-R1大模型

    从安装到API调用全流程指南 想不依赖网络、零门槛运行AI大模型?Ollama帮你轻松实现! 本文手把手教你部署DeepSeek模型,并通过本地API实现对话、编程、数据分析,小白也能秒变AI玩家! 一、准备工作:安装Ollama Ollama是一个轻量级工具,支持在本地一键运行大模型(如Llama、DeepSeek等),无需复杂配置。 1. 二、一键部署DeepSeek模型 Ollama内置了主流模型库,直接通过命令行拉取即可。 • 回复速度慢:关闭其他占用显存的程序,或尝试更小规模的模型(如deepseek-7b)。 通过Ollama,DeepSeek大模型的部署和调用变得前所未有的简单!

    3.4K10编辑于 2025-02-10
领券