首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏IT技术订阅

    DeepSeek分布式模型训练详解

    随着人工智能技术的飞速发展,大规模预训练语言模型(LLM)逐渐成为研究和应用的热点。DeepSeek作为一款高性能的预训练语言模型,其分布式模型训练技术在业界引起了广泛关注。 本文将从分布式训练架构、关键技术优化、训练过程、模型配置与超参数设置、数据集准备与处理以及训练任务启动等方面,深入解析DeepSeek的分布式模型训练过程。 五、数据集准备与处理 (一)数据集下载 以Wikitext-2数据集为例,需要下载数据集文件和分词模型文件。数据集的下载是训练过程的第一步,高质量的数据集是训练高性能模型的基础。 七、总结 DeepSeek的分布式模型训练技术在大规模预训练语言模型训练过程中发挥了重要作用。 同时,通过精心设计的训练过程、模型配置和超参数设置,DeepSeek能够在大规模数据集上进行稳定的训练,并生成高质量的语言模型

    1.5K11编辑于 2025-02-18
  • 来自专栏人工智能

    腾讯云AI实战:DeepSeek模型训练与微调

    那么本文就来详细介绍如何使用腾讯云的工具进行DeepSeek模型训练和微调,帮助大家快速上手并深入理解模型训练的实际操作。 模型微调:支持对预训练模型进行微调。资源管理:提供GPU/CPU资源管理,支持分布式训练2、HAI平台还有就是HAI平台,它是腾讯云提供的高性能AI计算平台,支持大规模分布式训练和推理。 DeepSeek致力于研究和开发先进的通用人工智能模型AGI,其模型包括DeepSeek LLM、DeepSeek MoE、DeepSeek V2DeepSeek-V3等,并且全部开源‌。 从零开始:DeepSeek模型训练接下来就来从头开始进行DeepSeek模型训练。(一)准备工作在开始训练之前,需要做些准备工作,如下所示:注册腾讯云账号:访问腾讯云官网,注册账号并完成实名认证。 2、编写训练脚本编写训练脚本,使用DeepSeek模型进行训练,这里用一个简单的训练脚本示例来给大家分享,具体如下所示:import tencentcloud from tencentcloud.tione.v20211111

    4.6K82编辑于 2025-02-06
  • 来自专栏《C++与 AI:个人经验分享合集》

    《探秘DeepSeek优化器:解锁模型训练的高效密码》

    在人工智能领域,模型训练的效率与效果紧密关联着其应用前景。DeepSeek作为备受瞩目的大语言模型,在众多自然语言处理任务中表现出色,这背后,适配的优化器功不可没。 今天,就让我们一同深入剖析DeepSeek使用的优化器特点,以及它们如何精准满足模型训练需求。 自适应学习率调节,灵活应对训练动态 DeepSeek采用的优化器具备自适应学习率调整机制。 在DeepSeek处理大规模文本数据时,这种自适应学习率调整机制让模型能根据不同阶段的训练需求,灵活调整参数更新步长,有效提升训练效率与效果 。 这种对分布式训练的良好支持,使得DeepSeek能够利用大规模集群的计算能力,处理海量数据,训练出更强大的模型DeepSeek使用的优化器凭借自适应学习率调节、高效梯度处理、分布式训练支持以及与模型架构的深度适配等特点,为模型训练提供了强大助力。

    41110编辑于 2025-02-20
  • 来自专栏罗西的思考

    Facebook如何训练超大模型 --- (2)

    [源码分析] Facebook如何训练超大模型 --- (2) 目录 [源码分析] Facebook如何训练超大模型 --- (2) 0x00 摘要 0x01 回顾 1.1 ZeRO 1.1.1 ZeRO 分布式训练 Parameter Sharding 之 Google Weight Sharding [源码分析] Facebook如何训练超大模型---(1) 0x01 回顾 1.1 ZeRO 我们首先回顾一下 深度模型训练之中,显存主要是被Model States 与 Activation 两部分所占用。 Model Parameter: 模型参数,即在训练过程中通过数据“学习”到的信息。 假如有3个,则每个worker分担了1/3,于是它们就把不属于自己的另外2/3(因为已经是冗余的了)释放掉。但是3个worker各自模型参数合并起来,恰好又是整个模型参数。

    2.4K30编辑于 2022-05-09
  • 来自专栏人工智能极简应用

    AI智能体研发之路-模型篇(二):DeepSeek-V2-Chat 训练与推理实战

    一、引言 5月6日私募基金幻方发布DeepSeek-V2,千亿级模型,每百万Tokens仅需1元-2元。 而被誉为大模型价格屠夫的“DeepSeek-V2”到底是怎么个事儿,是否可以进行训练和推理,今天我们来展开讲一讲。 二、模型简介 2.1 DeepSeek V2模型概述 DeepSeek V2(Moe)是一个基于专家网络(MoE)的大语言模型,是DeepSeek LLM(dense)的升级版本。 2.2 DeepSeek V2模型架构 DeepSeek-V2针对attention机制和MoE网络进行创新,保证经济的训练和高效的推理: 对于注意力,设计了MLA(多头潜在注意力),它利用低秩键值联合压缩来消除推理时键值缓存的瓶颈 三、训练与推理 3.1 DeepSeek V2模型训练 由于机器资源限制,这里基于QLoRA指令微调(SFT)DeepSeek V2的lite版(DeepSeek-V2-Lite-Chat),使用之前文章介绍的

    2.7K10编辑于 2024-08-13
  • 来自专栏GiantPandaCV

    如何看待 DeepSeek 发布的 MoE 大模型 DeepSeek-V2

    LLaMa3-70B 的 1/4; 训练成本估计: 理论计算量: 但实际的训练成本考虑到 MFU,假设 LLaMa3-70B 的 MFU 和 DeepSeek-67B 的 MFU 接近: DeepSeekV2DeepSeek-67B 的 GPU cost 因此实际的训练成本开销是 LLaMa3-70B 的 左右。 相较于目前的 Dense 模型和之前最流行的 MoE 模型, DeepSeekV2 的 Expert token 训练量 和 Attention token 训练量的差距是最大的: LLaMa3 训练 而 DeepSeekV2 则是在一个非常具有挑战性的稀疏程度上训练且效果很好的 MoE 模型,并第一时间开源,非常敬佩。 Expert Parallel Size = 8 Data Parallel Size (ZeRO1) = n DeepSeek V2 的分布式并行配置 @罗福莉 不知道训练时不开 Tensor Parallel

    1.1K20编辑于 2025-02-03
  • 来自专栏老张的求知思考世界

    DeepSeek模型的基本原理与训练方法

    本月初,即9月1日当天,DeepSeek公布了其大模型的基本原理和训练方法,下面是我整理的核心内容。 原文链接如下: https://cdn.deepseek.com/policies/zh-CN/model-algorithm-disclosure.html 一、模型的基本原理 DeepSeek模型基于大语言模型 DeepSeek所有模型均开源,通过MIT协议公开发布权重、参数和推理代码,并提供完整技术报告供社区参考。 2、优化训练阶段数据 数据来源于人工或自动化构造的问答对,部分可能基于用户输入。 保护用户隐私:对数据实施安全加密、去标识化和匿名化,避免关联特定个人。 警告提示:服务提供显著标识提醒用户内容可能不准确,强调模型输出仅供参考,不构成专业建议(如医疗、法律、金融)。 2模型的风险 滥用风险:包括隐私泄露、版权问题、数据安全和偏见歧视等。

    1.6K10编辑于 2025-10-10
  • 来自专栏人工智能领域

    DeepSeek Model Zoo:解锁预训练模型的宝藏地图(1218)

    摘要:DeepSeek Model Zoo 是一个集多种先进预训练模型于一体的宝库,涵盖自然语言处理(NLP)、计算机视觉(CV)和语音等多个领域。 DeepSeek Model Zoo 作为一个集多种先进预训练模型于一体的宝库,为研究者和开发者们提供了丰富的资源和强大的工具 。 [X] 毫秒 安防监控中的目标识别、图像检索等 CV 模型 - [CV 模型名称 2] [具体准确率数值] [具体召回率数值] [X]GB [具体推理速度数值] 医学影像分析中的图像分割、工业检测中的缺陷识别等 2] [具体准确率数值] [具体召回率数值] [X]GB [具体推理速度数值] 语音情感分析、多语言语音交互等 通过这一对比矩阵,读者可以快速了解不同模型在关键指标上的表现,从而根据自己的需求,如对准确率 领域适配策略:定制专属模型 DeepSeek 针对不同领域的特点,制定了一系列精准有效的迁移学习策略 。在选择预训练模型时,会充分考虑目标领域与预训练数据的相关性。

    55910编辑于 2025-02-28
  • 来自专栏AI

    DeepSeek NSA:突破数据瓶颈,开启AI模型训练新范式

    近日,中国AI公司深度求索(DeepSeek)发布了一项名为神经缩放增强(Neural Scaling Augmentation, NSA)的技术,通过创新的数据生成与模型优化方法,为突破现有训练瓶颈提供了全新的解决方案 DeepSeek NSA的核心创新在于将数据生成与模型训练深度融合: 动态数据合成引擎:通过预训练模型分析现有数据分布,生成符合任务需求的高质量合成数据,同时引入对抗性样本以增强鲁棒性; 缩放感知训练框架 :在训练过程中动态调整合成数据与真实数据的比例,结合课程学习策略,使模型逐步适应不同复杂度场景; 参数效率优化:通过稀疏激活和分层注意力机制,减少冗余计算,使模型在较小参数量下实现接近大型模型的性能。 行业影响:AI民主化的新里程碑DeepSeek NSA的推出可能引发行业级变革。 结语DeepSeek NSA的诞生标志着AI基础研究从“暴力缩放”向“智能缩放”的转型。随着合成数据生成、模型高效训练等技术的成熟,人工智能有望摆脱对数据规模的过度依赖,进入更可持续的发展阶段。

    88000编辑于 2025-02-18
  • 来自专栏人工智能

    DeepseekDeepSeek-R1训练方式分析

    .纯强化学习训练的语言模型 DeepSeek-R1-Zero研究者首先提出了一个完全基于强化学习(RL)训练模型DeepSeek-R1-Zero,该模型不依赖任何有监督微调(SFT)数据。 通过RL训练,DeepSeek-R1-Zero展现出了许多强大而有趣的推理行为,如自我验证、反思、生成长推理链等。这标志着纯RL训练语言模型是可行的,为未来研究指明了方向。 2.引入冷启动数据的RL模型DeepSeek-R1尽管DeepSeek-R1-Zero取得了优异的性能,但也存在着输出可读性差、语言混用等问题。 具体来说,DeepSeek-R1的训练分为四个阶段:1)冷启动阶段:收集数千条长推理链数据,在此基础上对预训练语言模型进行微调,作为后续RL的起点。 (2)推理导向的RL阶段: 类似R1-Zero,在冷启动模型上进行大规模RL训练。这一阶段侧重提升编程、数学、科学、逻辑推理等任务上的表现。

    1.2K10编辑于 2025-02-12
  • 模型训练高效集成】DINOv2 + SAM 2

    模型训练高效集成】DINOv2 + SAM 2 当目标检测遇上图像分割,AI 视觉正迎来一场静悄悄的革命。 引言 在人工智能尤其是计算机视觉迅猛发展的当下,我们正见证着一个又一个技术奇迹的诞生。 DINOv2:更强大的视觉基础模型 它从何而来? DINOv2 带来了几个关键优势: 即插即用:无需额外训练,直接提取高质量特征 卓越泛化:在未见过的数据和任务上表现优异 多尺度理解:同时捕捉局部细节和全局上下文 高效推理:相比需要微调的模型,大大节省计算资源 :无论是点、框、掩码还是文本描述,都能理解并作出反应 DINOv2 + SAM 2:免训练的完美组合 无缝集成架构 将 DINOv2 和 SAM 2 结合在一起的优势在于无需联合训练。 即插即用的优势 这种组合带来了前所未有的便利: 零训练开销:无需准备训练数据和计算资源 快速部署:下载即用,大大缩短项目周期 灵活组合:可以根据任务需求灵活调整集成方式 稳定可靠:基于经过充分验证的成熟模型

    1.3K20编辑于 2025-09-04
  • 来自专栏IT技术订阅

    DeepSeek EP并行专家通信技术解析:打破大模型训练瓶颈

    随着模型规模的不断扩大,传统的通信机制逐渐暴露出瓶颈,难以满足高效并行计算的需求。在此背景下,DeepSeek开源的DeepEP通信库应运而生,为解决这一问题提供了新的思路和技术方案。 本文将深入解析DeepSeek EP并行专家通信技术的核心机制,并探讨其在实际应用中的重要意义。 这些模型通过海量参数和复杂的神经网络结构,实现了对自然语言的高效理解和生成。然而,随着模型规模的不断增大,传统的单机训练模式已无法满足需求,分布式训练成为必然选择。 为了解决这些问题,DeepSeek开源了DeepEP通信库,专为MoE模型设计,旨在通过优化通信机制,打破大模型训练和推理的瓶颈,提升分布式计算的效率。 三、DeepEP通信库的实际意义 (一)提升训练效率 在大规模分布式训练中,通信效率是制约模型训练速度的关键因素之一。传统的通信机制往往存在带宽瓶颈和延迟问题,导致模型的迭代速度缓慢。

    1.5K00编辑于 2025-02-27
  • DeepSeek-OCR-2 开源 OCR 模型的技术

    DeepSeek-OCR-2开源OCR模型的技术OCR应用的场景和类型很广,本次使用Qwen2的架构,解决看的全(扫码方式优化)、看的的准(内容识别、视觉标记、降低重复率),多裁剪策略提取核心信息。 这两款模型代表了当前开源OCR技术的两大发展方向:DeepSeek-OCR-2主打视觉因果流(VisualCausalFlow)的创新架构,而HunyuanOCR则以极致轻量化+端到端统一见长。 1.2模型规格与性能指标DeepSeek-OCR-2参数量3B视觉编码器DeepEncoderV2(基于Qwen2-0.5B)语言解码器DeepSeek3B-MoE-A570M支持分辨率动态分辨率,最高 /视频字幕模型大小2GB20GBGPU显存可部署支持语言130+含14种高频小语种三、技术对比:DeepSeek-OCR-2vsHunyuanOCR对比维度DeepSeek-OCR-2HunyuanOCR 4.2GOT-OCR2.0:学术界的统一模型特点详情定位统一端到端OCR-2.0模型架构生成式预训练(类似LLM)特点强调整体文档理解适用场景学术研究、复杂版式文档对比结论:GOT-OCR2.0与DeepSeek-OCR

    1.2K10编辑于 2026-02-07
  • 来自专栏CSDN社区搬运

    语音预训练模型wav2vec

    因此,Wav2Vec在语音识别、语音合成、语音情感分析等领域有广泛的应用前景。 基本原理 文章提出一种无监督的语音预训练模型 wav2vec,可迁移到语音下游任务。 模型训练一个简单的多层卷积神经网络,并提出了一种噪声对比学习二分类任务(noise contrastive binary classification task),从而使得wav2vec可以在大量未标注的数据上进行训练 作者在实验中使用了两种不同的感受野模型, 一种为普通规模, 用来在一般数据集上训练, 另一种则是大规模(wav2vec larqe) 用来在大数据集上训练训练一个高质量的Wav2Vec模型通常需要大量的计算资源和时间。模型训练过程可能需要在大规模的语音数据上进行,并且可能需要使用分布式计算平台。 例如,Facebook fairseq 源码库提供了Wav2Vec相关的模型和工具,可以方便地训练和使用Wav2Vec模型

    1.6K10编辑于 2024-11-27
  • 来自专栏网络虚拟化

    如何评价 Deepseek 新发布的 DeepSeek-Prover-V2-671B 模型?

    模型架构:大而灵活 混合专家的路子 DeepSeek-Prover-V2-671B 是从 DeepSeek-V3-Base 改出来的,用了个叫混合专家(MoE)的架构,总参数有 6710 亿,但实际干活时只调大概 训练过程:数据加聪明算法 先打基础 DeepSeek-Prover-V2-671B 从 DeepSeek-V3-Base 开始,这是个在 14.8 万亿 token 上预训练模型,数学、代码、Lean V2 估计数据更多,或者难度更高了。 微调加强化 预训练后,先用监督微调教它写证明,数据是问题-证明对,重点练 Lean 4 的语法和逻辑。 ProverBench:DeepSeek 新出的测试,325 个题,有 AIME 2024、2025 的题,具体成绩没公布,但应该比 V1.5 好。 跟别人比 比起其他证明模型,V2 领先不少。 最后说两句 DeepSeek-Prover-V2-671B 是 AI 证明数学定理的一个大步。它的 MoE 架构、智能训练和开源让人眼前一亮,在 MiniF2F、PutnamBench 上成绩亮眼。

    61110编辑于 2025-05-04
  • 来自专栏AI研思录

    白话科普 | 看完即可上手DeepSeek训练,构建专属大模型,LoRA技术让你轻松训练行业大模型

    微调的基本概念 微调(Fine-tuning)是指在已经训练好的大模型基础上,针对特定任务或场景进行进一步训练的过程。与从零开始训练一个模型相比,微调可以大幅降低时间、计算资源和数据的需求。 例如,DeepSeek的成功证明了,即使没有顶级GPU,也可以通过算法优化实现顶尖性能。 2. 数据质量的重要性 尽管微调降低了对数据量的需求,但对数据质量的要求却越来越高。 2. 防止过拟合 微调过程中,模型可能会因为数据量较少而出现过拟合现象。为了防止这种情况,可以通过以下方法进行优化: 增加正则化:如L2正则化或Dropout。 2. 联邦学习与隐私保护 联邦学习是一种分布式机器学习方法,允许多个设备或机构在不共享数据的情况下共同训练模型。未来,微调技术可能会与联邦学习相结合,从而在保护数据隐私的同时实现模型的优化。 3. DeepSeek的成功只是一个开始,未来还有无数机会等待我们去探索。----

    2K11编辑于 2025-02-20
  • 来自专栏Dance with GenAI

    图解DeepSeek-R1大模型—推理型大语言模型(LLM)的训练秘密

    本文目录: ●大型语言模型(LLM)训练方式回顾 ●DeepSeek-R1 训练配方 ●1 - 长推理链监督式微调(SFT)数据 ●2 - 一个中期高质量推理 LLM(但在非推理任务上表现较差)。 ●DeepSeek-R1 训练配方 DeepSeek-R1 遵循这一通用配方。第一步的详细信息来自之前关于 DeepSeek-V3 模型的论文。 这些都可以直接用作改进模型的信号。当然,这是在许多示例(以小批量)和连续训练步骤中完成的。 这些奖励信号和模型更新是模型在 RL 训练过程中不断改进任务的方式,如论文中的图 2 所示。 ●模型架构 与 GPT2 和 GPT 3 问世之初的模型一样,DeepSeek-R1 是一堆 Transformer 解码器块。它由 61 个这样的块组成。 》 至此,你应该已经掌握了围绕 DeepSeek-R1 模型的主要训练方法

    1.7K20编辑于 2025-02-07
  • 来自专栏《Cloud Studio》

    CloudStudio 公开课-DeepSeek R1 模型训练与优化实战

    R1 模型训练与优化实战》,这套教程系统解析了DeepSeek R1推理模型的多阶段强化学习与监督微调技术框架,适合AI开发者和研究者掌握前沿大模型训练范式,实现复杂任务场景下的模型性能突破与低成本高效部署 第一章:环境设置与数据准备1.1 课程介绍1.2 环境配置1.3 训练数据集选择第二章:模型架构与训练框架2.1 DeepSeek R1 训练快速概述2.2 选择基本模型2.3 RL 策略模型(R)第三章 5.7 保存我们的小小R1模型第六章:SFT 阶段2与后续优化6.1 以推理为导向的强化学习6.2 拒绝采样6.3 SFT 阶段2后续训练6.4 模型蒸馏如何使用 CloudStudio 公开课第一步进入 cloudstudio.net ——【学习中心】——【DeepSeek R1 模型训练与优化实战】第二步点击章节进入学习第三步进入具体章节,例如【1.3 训练数据集选择】章节。 在 ide.cloud.tencent.com 平台上使用 DeepSeek 相关模板2. 将实践经验以视频或文章的方式发布到任意媒体渠道(包括但不限于B站、抖音、小红书、个人博客等)。

    43710编辑于 2025-03-11
  • 来自专栏AgenticAI

    如何使用vLLM部署DeepSeek V2 Lite模型

    conda activate base pip install modelscope 然后我们访问modelscope找到我们要下载的模型,比如DeepSeek V2 Lite模型[2]。 开始部署 使用如下命令,开始部署DeepSeek V2 Lite Chat模型。 /DeepSeek-V2-Lite-Chat/' quant_path = 'hub/deepseek-ai/DeepSeek-V2-Lite-Chat-awq-int4/' quant_config V2 16B模型的过程。 参考资料 [1] ModelScope: https://modelscope.cn/models [2] DeepSeek V2 Lite模型: https://modelscope.cn/models

    2.2K10编辑于 2025-03-18
  • 来自专栏开发经验

    DeepSeek本地部署+微调训练

    查看训练日志训练文件夹会生成 training_logs.txt,重点关注:Epoch 1/3 | Loss: 2.34 → 1.78Epoch 2/3 | Loss: 1.78 → 1.23五、部署训练好的模型 建议首次训练先用100条数据测试流程,成功后再扩大数据量。训练方案属于在原有DeepSeek-R1基础上的微调(Fine-tuning),而不是从头创建新模型。 验证模型基础在Open WebUI输入:/show /model info如果看到 base_model: deepseek-r1 说明确实是基于原模型2. 安全回滚方案如果训练效果不好,只需:rm ~/.ollama/models/deepseek-custom.gguf # 删除微调模型ollama run deepseek-r1 # 立即恢复原始版本四、商业合规提醒模型版权:微调后的模型仍需遵守DeepSeek的使用协议数据安全:建议训练数据去除敏感信息,可通过命令检查:grep -r "身份证号|手机号" .

    4.1K23编辑于 2025-02-25
领券