首页
学习
活动
专区
圈层
工具
发布
首页标签第四期热点征文-大模型技术

#第四期热点征文-大模型技术

大模型激活函数迭代演进:SwiGLU替代传统ReLU/GELU激活逻辑提升模型性能18.9

未闻花名

在前一期《大模型主流激活函数解析:ReLU/GELU/SwiGLU 原理差异,拆解 FFN 前向逻辑》内容中,我们已经系统认识了神经网络激活函数的基础作用:线性...

1200

大模型主流激活函数解析:ReLU/GELU/SwiGLU原理差异,拆解FFN前向逻辑18.8

未闻花名

很多刚接触大模型微调、模型结构分析、推理优化的同学,第一眼看到 Transformer、FFN 前馈网络、SwiGLU、GELU、ReLU 这些名词都会觉得很抽...

5410

大模型参数规模拆解:十亿百亿千亿模型能力差异,结构配比决定AI智能上限18.7

未闻花名

相信我们做大模型应用实践过程中,一直都有一个根深蒂固的认知:大模型参数越多,智商就越高,效果就越厉害。于是行业也疯狂卷千亿参数、万亿参数模型,让大众也默认参数越...

12410

FlashAttention、PagedAttention两代注意力算法,改写大模型推理生态详解18.6

未闻花名

大模型能够实现流畅对话、长文本理解、多轮交互应答,核心底层完全依靠自注意力机制。但早期原生Transformer注意力,天生带着算力与显存双重致命缺陷,序列长度...

9710

词嵌入Embedding:Token离散转连续向量规则、RoPE特性、微调适配实践18.5

未闻花名

如果接触过大模型调用、或从事AI应用开发的工程师,基本天天都和Embedding打交道,分词Token、向量检索、语义匹配、RAG知识库、大模型对话生成,处处都...

13010

大模型幻觉本质:源于Transformer架构天生固有缺陷 + RAG根治方案参数调优18.4

未闻花名

不知道大家是不是也一样,做大模型应用做的久了,回过来头来总结思考,一直都有一个误区:总觉得大模型胡说八道、编造事实的幻觉问题,改改代码、修修bug、优化一下推理...

23321

揭秘大模型通用8192维度奥秘:千亿大模型为何统一采用8192隐层维度的真相18.3

未闻花名

经常接触大模型、应用过模型权重配置的朋友一定会发现一个特别有意思的现象:不管是国内主流开源大模型,还是其他通用对话大模型,不管是7B、13B、70B还是更大参数...

27721

大模型竞争持续升温,企业数字化转型提速

我的建站日记

如果说2023年是大模型的“诞生元年”,那么2026年无疑是其“落地决战之年”。从百模大战的野蛮生长,到如今头部阵营的格局初现,大模型赛道的竞争非但没有降温,反...

8210

大模型超长上下文显存控制:原生注意力缺陷、长文本显存暴涨原理与优化实践.180

未闻花名

大模型上下文长度,简单来说就是模型单次对话、单次推理能够记住并处理的文本总Token数量。早期开源大模型普遍只有4K、8K上下文,只能处理短篇对话、简短文档、小...

50055

RTX 4090显存终极优化:模型分层加载、CPU Offload显存和内存动态置换实践17.9

未闻花名

大语言模型的显存占用,是所有优化的核心起点。对于搭载24GB显存的RTX 4090,我们首先要明确:模型本身、推理计算、中间张量、上下文窗口,是四大显存消耗源头...

19521

基于OpenCV人脸检测与DeepFace视觉识别实现情绪抓拍、数据分析智能研判系统17.8

未闻花名

由于长期深耕青少年心理健康相关工作,在日常情绪疏导、心理状态观测中积累了大量实践经验,深刻意识到青少年情绪细腻多变、外在表达含蓄,很难通过简单交流精准捕捉真实内...

19110

大模型应用两大经典限流算法:漏桶算法vs令牌桶算法铸就大模型流量治理基石.177

未闻花名

限流算法是用于控制请求处理速率、保护服务资源的标准化算法,是所有流量管控策略的底层核心。在大模型服务中,算法的作用不再是简单限制请求数量,而是精准管控GPU 算...

20620

全新服务器大模型部署进阶:RTX 4090显卡驱动安装与模型运行容错适配指南.176

未闻花名

前面我们已经完整讲过全新服务器从零搭建、部署运行大模型的全套流程,今天咱们就在这个基础上,继续往下做关键一步:给服务器配置独立显卡,打通 GPU 硬件加速能力。...

24900

新服务器从0到1完整部署实践:openEuler环境搭建ChatGLM2大模型完整流程.175

未闻花名

玩过Linux服务器部署的都知道,这事特别熬人、格外劳心,尤其是碰上特定定制版本的Linux系统,各种环境兼容、配置坑点层出不穷,稍有不慎就卡死报错,出于习惯,...

16410

大模型GPU服务资源与性能监控:基于ChatGLM3模型的自动化巡检应用实践.174

未闻花名

传统业务监控只关注接口响应、CPU内存、网络状态,完全适配不了大模型推理场景。大模型服务监控是面向推理全链路的专属可观测体系,覆盖请求接入、文本分词、模型前向计...

18910

封神与阵痛:Kimi K3 的破局、狂欢与中国大模型的“甜蜜负担”

jack.yang

2026年7月17日,当这款拥有2.8万亿参数的混合专家(MoE)大模型悄然上线时,整个全球科技圈迎来了一场久违的震动。在Artificial Analysis...

61920

高并发下大模型服务降级策略:模型层、检索层、知识库层、缓存层协同设计.173

未闻花名

在大模型服务大规模落地后,系统随时面临高并发流量突增、GPU 算力耗尽、大模型推理超时、向量数据库宕机、知识库服务故障、网络抖动、资源占用超限等各类线上异常。若...

23710

大模型GPU推理队列排队治理:限流规则+优先级调度+长短拆分+集群负载指南.172

未闻花名

大模型推理队列是承载用户各类生成请求的缓冲调度载体。不同于普通Web接口,大模型单次推理消耗大量GPU显存与算力,无法瞬时并发处理海量请求。

32210

幂等性在大模型服务中的核心应用:解决重复请求、重复扣费与重复推理问题.171

未闻花名

在大模型API接口、对话会话服务、知识库RAG接口线上落地过程中,重复请求是无法规避的常态问题。客户端网络抖动、前端按钮连续点击、浏览器页面刷新、接口超时自动重...

21410
领券