首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 构建可靠AI模型7核心技术

    模型性能是否会下降?在什么情况下模型不再可行?当环境中的微小变化导致功能和准确性发生巨大变化时,模型就被认为是非弹性或“脆弱”的。脆弱性是软件工程中的已知概念,也适用于AI。 数据可靠性经验模型的质量仅取决于用于开发模型的训练和测试数据。如果对数据质量相对于真实世界的代表性没有信心,模型的输出可能无法在操作环境中可靠地提供准确输出。 当模型输出或预测与预期不同时,将数据分类用于分析和调查。常用于此类分析的数据类型包括事件发生时间(模型偏离需要多长时间)、退化数据(关于模型如何退化的信息)和复发事件数据(发生多次的错误)。 检查模型稳健性和准确性的频率应取决于模型的优先级和模型更新的频率。高风险、定期更新的模型最好每天检查(由人类验证输出)。 这些可能是技术方法,组织的数据科学专业人员可以探索新想法如何支持部署的AI以及模型开发。例如,“Lipschitz约束模型”具有有界导数,可以帮助神经网络对对抗性示例更加稳健。

    46400编辑于 2025-08-30
  • 来自专栏帅云霓的技术小屋

    模型与AI底层技术揭秘 (7) 卡车搬运的数据

    = np.float32(np.random.rand(2, 100)) # 随机输入 y_data = np.dot([0.100, 0.200], x_data) + 0.300 # 构造一个线性模型 我们对这段python代码进行解读: 在第1行引入了tensorflow的类库后,9-11行利用tensorflow类库定义线性模型,随后13行定义残差为均方误差(mean square error), 次迭代,每20次输出一次迭代过程数据,得到拟合结果,工作流程如下图: 我们发现,在利用Tensorflow开发的机器学习代码中,程序员完全不需要自己实现任何算法的细节,只需要调用Tensorflow提供的模型就可以了 让我们再回到《模型与AI底层技术揭秘 (2) 人妖之间的国度》中提到的“算盘打出原子弹”的故事。实际上,这是一个典型的分布式并发计算的场景。Tensorflow也提供了分布式训练的能力。

    54420编辑于 2023-10-30
  • 来自专栏猫头虎博客专区

    小米MiMo:7B模型逆袭AI模型战场的技术密码

    小米MiMo:7B模型逆袭AI模型战场的技术密码 在模型竞争愈发激烈的2025年4月30日,小米以一款名为 MiMo-7B 的开源模型强势突围,在数学推理与代码能力评测中表现亮眼,不仅与规模更大的模型正面对抗 最终,MiMo累计训练了 25万亿 tokens,这一数据在7B模型中堪称顶级,为其强悍能力打下坚实基础。 2. 2024年底,95后AI大佬 罗福莉 加盟小米,以千万年薪领导模型研发团队。 她不仅是 DeepSeek-V2 的核心开发者,还推动了 MLA(Multi-head Latent Attention) 技术的发展,这项技术在降低模型部署成本上发挥了关键作用。 结语:小米的新角色,是AI生态的创变者 MiMo的发布,不仅标志着小米在模型赛道的技术跃升,更意味着其正在从“智能终端制造商”迈向“AI生态运营者”。

    1.7K10编辑于 2025-05-02
  • 来自专栏IT从业者张某某

    语言模型-1.2-模型技术基础

    简介 1.2 模型技术基础 语言模型 预训练阶段会得到base model,本质上就是一个互联网文本模拟器,这个阶段需要上万台服务器训练几个月的时间,这个生成的模型可以认为是互联网的有损压缩。 构建一个语言模型 语言模型预训练(Pre-training) 使用与下游任务无关的大规模数据进行模型参数的初始训练 ➢ 基于Transformer解码器架构,进行下一个词预测 ➢ 数据数量、数据质量都非常关键 Scaling Law) ➢ 通过扩展参数规模、数据规模和计算算力,语言模型的能力会出现显著提升 ➢ 扩展定律在本次大模型浪潮中起到了重要作用 语言模型采用了与小型预训练语言模型相似的神经网络结构 ,从而获得更可靠的答案 涌现能力与扩展定律的关系 ➢ 涌现能力和扩展定律是两种描述规模效应的度量方法 模型核心技术 ➢ 规模扩展:扩展定律奠定了早期模型技术路线,产生了巨大的性能提升 需要设计对齐技术减少模型使用风险,并进一步提升模型性能 ➢ 工具使用:使用外部工具加强模型的弱点,拓展其能力范围

    78010编辑于 2025-03-15
  • 来自专栏云数据库技术

    语言模型技术原理

    除了自然语言本身的优势外,语境的上下文学习能力、迁移学习和文字总结能力也有很大的发挥空间,带着这些思考,我们有必要了解一下语言模型背后的发展及其技术原理。 一、语言模型的发展 语言模型作为一个被验证可行的方向,其“”体现在训练数据集广,模型参数和层数,计算量大,其价值体现在通用性上,并且有更好的泛化能力。 最终训练出来的模型在不需要任何参数和模型改动下,在zero-shot(零样本)任务中,在8个数据集中有7个表现为业界最优,这个泛化能力可以说已经很强大了,并且在机器翻译场景取得亮眼结果,GPT也是在2.0 1.6 当前的技术局限性 专业的领域,缺乏语料训练的情况下,GPT无法生成合适的回答。 可信度问题,缺乏答案的具体来源。 时效性问题,模型底层训练数据是过往数据,再一次训练的成本很高。 最后,语言模型作为一个被验证可行的方向,其“”体现在数据集广泛,参数和层数,计算量大,其价值体现在通用性上,有广泛的应用场景。

    2.5K45编辑于 2023-05-30
  • 来自专栏Java技术

    AI技术模型技术LLM

    -CoderOilStation(程序员编程助手科技股份有限责任公司)AI技术模型技术LLM人工智能技术AI是美国高等院校哈佛大学的一种原型框架技术。AI技术西方和全球的部署研发和运用。 AI人工智能引领全球技术的更新和迭代监控不同的区域。相信知识不要服从于命运。美国麻省理工学院MIT会同步不同的领域模型驱动技术DDD(DomainDrivenDesign)。 领域模型驱动技术西方发达社会更注重不同想法和设计的美学应用。协会institute是定义技术标准的国际性知识传播组织。亚洲的工程师杰作Agent智能体应用于基本的搜索应用和广告商品推荐。 私有用户和公众的开放平台用户一小一意味着平台的设计开始运行正常。模型LLM(LargeLanguageModel)模型开放基础框架的模型搭建方式。很多的应用逻辑都是有编程范式和编程方法学。

    29010编辑于 2026-03-08
  • 来自专栏数据派THU

    详解:7经典回归模型

    来源:csdn 深度学习爱好者本文约2900字,建议阅读5分钟本文给大家介绍机器学习建模中7经典的回归分析模型。 什么是回归分析? 回归分析是一种预测性的建模技术,它研究的是因变量(目标)和自变量(预测器)之间的关系。这种技术通常用于预测分析,时间序列模型以及发现变量之间的因果关系。 Linear Regression线性回归 它是最为人熟知的建模技术之一。线性回归通常是人们在学习预测模型时首选的技术之一。 7. ElasticNet回归 ElasticNet是Lasso和Ridge回归技术的混合体。它使用L1来训练并且L2优先作为正则化矩阵。当有多个相关的特征时,ElasticNet是很有用的。 除了这7个最常用的回归技术,你也可以看看其他模型,如Bayesian、Ecological和Robust回归。 如何正确选择回归模型? 当你只知道一个或两个技术时,生活往往很简单。

    1.9K41编辑于 2023-04-18
  • 来自专栏澜舟科技 NLP

    模型落地实践:同花顺模型技术应用及优化

    文内从业务角度介绍了模型技术在同花顺业务上的应用以及未来探索的方向。众所周知,模型参数量大,通用能力强,综合性能好。 所以最初在业务角度并不够重视,然而近期随着模型技术的快速发展,我们也在逐步尝试将模型在业务中落地,目前模型在自然语言处理相关的业务里都取得了比传统模型更优的效果,下面详细介绍相关工作。 确实在我们的业务模型里,规则占比非常,也是因为涉及用户财产问题,技术上会比较保守。下面具体介绍问答系统里模型应用的经验和取得的成果。 Continue-Train为了进一步提升模型在实际业务中的效果,同花顺与澜舟科技合作,引入孟子Mengzi 模型中的技术 ,针对模型进行 Continue-Train 训练,让模型更适用于金融相关的 总结模型技术在同花顺业务中的应用基本都有比较好的通用性,并且带来了比较好的性能提升,我们也希望在医疗、法律、教育等领域的子公司业务中推广,同时和澜舟科技以及学术界的老师们合作,把模型用得更好,谢谢大家

    3.3K20编辑于 2022-08-11
  • 来自专栏京东技术

    模型技术及趋势总结

    7. 2020s:模型和多模态学习 ◦模型如chatGPT、Claude、Gemini、Llama、chatglm、Kimi等等都展示了强大的能力。 •对模型进行加固,提高其抗攻击能力。 •采用加密存储和差分隐私技术来保护数据隐私。 •增强模型的可解释性,以便更好地理解和控制模型行为。 RAG(Retrieval-Augmented Generation) 什么是RAG ‍RAG(Retrieval-Augmented Generation)技术是一种结合检索和生成的方法,用于提升语言模型 LLM Agent 的应用 •自动化客服:LLM Agent可以提供24/7的客户服务,自动回答用户的查询,提高服务效率和用户满意度。 多模态模型是人工智能领域的重要进展,它们通过整合多种类型的数据,显著提升了模型的表现力和鲁棒性。这不仅使得人工智能系统能够更好地理解复杂的现实世界,也为未来的技术发展带来了无限可能。

    1.1K10编辑于 2024-07-04
  • 模型技术之Python基础

    Python,作为人工智能时代的通用语言,正是连接模型技术与商业价值的那座桥梁。用 Python 基础打底,不仅能让你学得更稳,更能让你在变现之路上跑得更快。 一、 穿透技术黑盒,从“调包侠”进阶为“应用构建者”在当前的模型应用层开发中,Python 占据着绝对统治地位。 三、 驾驭 AI 生态工具,构建不可替代的职场护城河模型技术迭代极快,今天流行 LangChain,明天可能就有新的框架出现。 结语AI 时代,机会属于那些既能仰望星空懂技术,又能脚踏实地写代码的人。Python 不是模型学习的障碍,而是助飞的翅膀。 与其在概念的海洋中漂浮,不如沉下心来,用 Python 基础打底,构建起坚实的技术底座。当你用一行行代码将模型转化为解决实际问题的产品时,你会发现,变现不再是焦虑的等待,而是水到渠成的必然。

    24110编辑于 2026-03-20
  • 来自专栏啄木鸟软件测试

    模型测试:技术深度解析

    与此同时,传统软件测试范式——基于明确输入/输出断言、覆盖路径与边界值的方法——在模型面前频频失效。 这些案例揭示一个现实:模型测试不是‘加个Prompt跑几轮’,而是一场融合认知科学、统计推断、对抗攻防与领域知识的系统工程。 一、为何传统测试方法在模型面前失灵? 根本原因在于模型的三非确定性特征: 1)输出不可重现性:相同Prompt在不同温度(temperature)、采样策略(top-p)或微调版本下,可能生成语义一致但结构迥异的回答,甚至逻辑矛盾; 二、模型测试的四维技术框架 业界领先实践已形成可落地的四维测试体系: ✅ 1. 三、实战案例:某省级政务模型的测试攻坚 该模型需支撑12345热线智能分派与政策解读。

    28200编辑于 2026-06-15
  • 来自专栏大模型&AIGC

    6种模型微调技术

    值得一提的是,通过使用T5模型进行模型大小的消融实验,我们展示了提示微调随着规模的增加变得更加具有竞争力:当模型参数超过数十亿时,我们的方法“缩小了差距”并达到了模型微调(即调整所有模型权重)的强大性能 这一发现尤为重要,因为大型模型的共享和部署成本高昂,而能够重用一个冻结的模型来执行多个下游任务可以减轻这一负担。 ,无需verbalizer(4) 特点在小、模型上,效果均优于P-tuning。 随着我们预训练更大的模型,全面微调(即重新训练所有模型参数)变得不太可行。以GPT-3 175B为例,部署独立的微调模型实例,每个实例都有175B参数,成本是极其昂贵的。 在wikiSQL/MultiNLI数据集上测试得出结论:小的γ值,能达到较好好的效果(一般为4-8)(7) 特点优点:用于低资源的场景。也就是硬件设备资源有限的情况下。更新参数量少。

    3.3K00编辑于 2025-05-08
  • 来自专栏架构之巅

    模型相关技术-初识RAG

    简单来讲就是让用户的问题先经过一个提前预置的专业知识库,先检索知识库,将知识库的响应提交给模型,让模型总结输出,或者直接就输出了,不经过大模型总结。 为什么需要RAG 模型在没有答案的情况下提供幻象数据,也就是胡说八道。 当用户需要特定的当前响应时,提供过时或通用的信息,模型提供的最新信息为训练模型时的数据。 图片 向量(vector)是在语言模型、知识库交互、计算过程中的重要指标。它可以将文本和知识表示为数学向量,实现文本相似度计算、知识库检索和推理等功能。 是的,整体的流程是和es类似,哪思考一个问题为 什么不用es,反而用这么复杂的模型来实现呢? - 哔哩哔哩 (bilibili.com) 我正在参与2024腾讯技术创作特训营最新征文,快来和我瓜分大奖!

    82941编辑于 2024-04-28
  • 来自专栏博文视点Broadview

    云存储技术首次全景展现,7技术趋势解读

    如何保证全年 7×24 小时不间断的超高可用性? 如何保证用户的数据安全? 如何利用数据生命周期? 如何根据用户的需求弹性地部署和调度资源? 如何实现数据管理和调度的高效及智能化? 专家亲笔书评 本书系统地讲解了与存储相关的技术体系和技术细节,以及阿里云存储的关键技术与组件,还对云存储的未来进行了展望。 ——孙凝晖 中国工程院院士,中国科学院计算技术研究所研究员 本书并不是一本仅讲述阿里云存储技术细节的书,它还对云存储技术的发展有着总体把握和深刻思考。 本书在具体介绍阿里云存储的技术和架构之前,介绍了一些基础性的技术知识,可使读者循序渐进地学习,大大增强了可读性。 自此,云计算三技术支柱终于集齐! 发布:刘恩惠 审核:陈歆懿 如果喜欢本文欢迎 在看丨留言丨分享至朋友圈 三连  热文推荐   因果推断与机器学习,终于有本书能讲明白啦!

    99320编辑于 2023-04-04
  • 来自专栏大模型应用

    模型应用:模型参数调优:结合本地模型对比多种组合探索差异.7

    引言 在模型的应用中,参数调优是连接模型潜力与实际效能的关键桥梁。与传统的软件参数不同,模型的生成参数更像是一组精密的调控旋钮,它们不改变模型的基础知识,而是影响模型如何思考和表达。 理解这些参数的本质,不仅能够提升模型输出的质量,更是将模型从玩具转变为工具的关键一步。 今天我们将从理论基础到实践应用,全面解析模型的核心参数体系,详细的介绍模型推理中常用的参数项,并通过本地模型示例展示参数调整对模型效能的影响。常见参数项:max_length:生成文本的最大长度。 Dict, Anyimport pandas as pdfrom modelscope import snapshot_downloadclass ModelParameterTester: """模型参数测试器 分步调优流程图五、总结 模型的参数调优本质上是在控制与释放之间寻找平衡的艺术。

    1.1K32编辑于 2026-02-04
  • 构建可靠AI模型7技术

    Ammanath是某机构全球AI研究院的执行董事,并领导某机构的可信与伦理技术部门。 在AI模型训练中,数据集是现实世界的代理。模型在一个数据集上训练,在另一个数据集上测试,如果结果相似,则预期模型功能可迁移到运行环境中。在实验室中有效的方法应在现实世界中持续有效,但能持续多久? 企业在扩展其AI应用范围时的任务是:将鲁棒性和可靠性作为AI战略的组成部分加以权衡,并协调能够管理并纠正动态环境中错误的流程、人员和技术。为此,我们从鲁棒可靠AI领域的一些基本概念开始。 检查模型鲁棒性和准确性的频率应取决于模型的优先级以及模型更新的频率。高风险、频繁更新的模型最好每天检查一次(由人工验证输出)。 这些很可能是技术性方法,组织的数据科学专业人员有能力探索新想法如何支持已部署的AI以及模型开发。例如,“Lipschitz约束模型”具有有界导数,可以帮助神经网络更鲁棒地抵御对抗性样本。

    27710编辑于 2026-05-07
  • 来自专栏xiaosen

    模型Prompt-Tuning技术入门

    」的范式,如Bert+fine-tuning的NLP任务,相比于第二范式,模型准确度显著提高,模型也随之变得更大,但小数据集就可训练出好模型; 第四范式:基于「预训练模型+Prompt+预测」的范式,如 4 Prompt-Tuning技术发展历程 Prompt-Tuning自GPT-3被提出以来,从传统的离散、连续的Prompt构建、走向面向超大规模模型的In-Context Learning、Instruction-tuning 因此我们总结人工设计方法的缺陷: 采用人工构建的方法成本高,需要与领域任务相关的先验知识; 人工设计的Pattern和Verbalizer不能保证获得最优解,训练不稳定,不同的PVP对结果产生的差异明显,方差; )方法为每一个输入文本假设一个固定前缀提示,该提示表由神经网络参数化,并在下游任务微调时进行更新,整个过程中预训练的模型参数被冻结。 Prompt Tuning特点: 优点: 模型的微调新范式 模型参数规模了之后,可以将模型参数固定,指定附加参数来适配下游任务,而且适配性能基本和全参数微调相当。

    1.6K30编辑于 2024-06-05
  • 来自专栏TGLTommyAI前沿技术论文

    论文解读: 百川模型7B和13B技术报告

    百川2技术报告详细介绍了模型的研发细节,包括7B和13B两个版本,以及在2.6T数据上进行了训练。报告还提及模型在数学、代码能力以及医疗和法律任务上的显著改善,并对模型安全性能力的提升方法进行了公布。 1.3.1 位置向量 Positional Embeddings Baichuan-2-7B采用了Rotary Positional Embedding (RoPE)技术,而Baichuan-2-13B ② 精度: 整个模型使用BFloat16混合精度进行训练,与Float16相比,BFloat16具有更好的动态范围,使其对于训练大型语言模型中的值更为稳健。 ③ NormHead: 为了稳定训练并提高模型性能,文中介绍了NormHead技术,它对输出嵌入(也称为‘head’)进行了标准化。NormHead在实验中有两优势。 ④ Max-z loss: 在训练过程中,发现大型语言模型(LLMs)的logits可能变得非常

    3K30编辑于 2023-10-22
  • 来自专栏深度学习与python

    Hugging Face 语言模型优化技术

    作者 | Sergio De Simone 译者 | 明知山 策划 | 丁晓昀 语言模型的生产部署存在两个主要的挑战,一个是需要大量的参数,一个是需要处理非常长的用于表示上下文信息的输入序列 Hugging Face 基于他们提供模型服务的经验分享了一些克服这些障碍的技术语言模型需要大量的 VRAM 来加载,从几十 (bigcode/starcoder) 到数百 GB (Llama、Bloom、GPT3)。 在生产环境中部署语言模型的第三项优化措施是选择正确的架构,让它们能够有效地处理长文本输入。 位置嵌入通过将每个标记的位置编码为数字表示来帮助语言模型理解序列顺序。对于需要处理大型文本输入任务的语言模型,应该使用 RoPE 和 ALiBi 等相对位置嵌入技术进行训练。

    54910编辑于 2023-10-09
  • 模型技术之Linux及Shell

    模型环境搭建靠 Linux,技能越硬,升职加薪越快在人工智能浪潮席卷全球的今天,模型(LLM)已然成为技术圈最耀眼的明珠。 那些能够深入 Linux 底层,熟练驾驭模型环境搭建的工程师,正在用最“硬核”的基础能力,通过技术杠杆,撬动着职场升职加薪的最快路径。 然而,模型时代的到来,为 Linux 教育赋予了全新的现实意义。模型的训练与推理,对计算资源有着极致的渴求。 如果你不懂得如何通过 Linux 参数优化内核性能,不懂得如何排查环境依赖的深层错误,那么面对模型这一庞然物,你只能停留在“会调用”的浅层,无法触及技术的内核。 二、 祛魅与实战:环境搭建能力检验真功夫在当下的技术培训市场中,充斥着各种“速成”课程,鼓吹几行代码即可玩转模型。这种教育泡沫掩盖了真实的工程难度。然而,真正到了企业级的生产环境,情况截然不同。

    27010编辑于 2026-03-20
领券