首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏韩曙亮的移动开发专栏

    【AI 模型】Meta Llama 3 模型 ( Llama 3 模型简介 | Ollama 软件下载安装 | Llama3 模型下载 | Llama 3 模型 在线 离线 使用 )

    首先 , 安装 Ollama 软件 , 到 https://ollama.com/ 下载安装 ; 然后 , 运行 ollama run llama3 命令 , 即可开始使用 Llama3 模型 ; 一 、Meta Llama 3 模型安装 1、Llama 3 模型简介 Llama 3 模型 是 Meta 公司 发布的 模型 , Meta 公司 就是 Facebook ; Llama 3 模型 Llama3 模型 ; 下载的模型放在了 C:\Users\用户名.ollama 目录中 , 在我的电脑上的路径是 C:\Users\octop.ollama ; 这个模型很大 , 有 4.7 G 安装完成后的效果 for help) 二、Meta Llama 3 模型使用 1、Llama 3 模型在线使用 在命令行中 , 可以直接进行对话 , 下面是对话内容 : D:\Llama>ollama run llama3 for help) 2、Llama 3 模型离线使用 Llama 3 模型 联网时 , 可以访问云端服务 , 可以生成更加丰富的文本 ; Llama 3 模型 在 断网后也可以使用 , 下面是断开网络后

    2K12编辑于 2024-08-09
  • 模型应用开发实战

    至此最简单的模型应用开发完毕。 提供API支持 上面最简单的Hello world写完了,接下来就要为各种客户端提供接口服务了。. 不得不吐槽下,模型也搞前后端分离这套!. net java 有httprequest,js有jquery、axios,模型也有个出名的库langchain,官方的解释它提供了“链”的概念,允许开发者将多个语言模型调用、API请求、数据处理等操作链接起来 为了搞模型的人能安心研究模型,不用花精力在界面上。市场上就出现了2个常用的模型web界面框架Gradio和Streamlit,不用去研究哪个更好,顺手就行! 最后 经过无数的蹂躏,我开发了个小应用【i歌词】,无任何条件免费提供全部源码。它基于chatglm4-9b模型,从部署到训练,通用对话功能,核心根据歌名查歌词并创作歌词!

    1.6K37编辑于 2026-05-08
  • 来自专栏xiaosen

    LangChain模型应用开发

    LangChain作为一个新兴的框架,旨在简化模型应用的开发过程。它提供了一套工具和接口,帮助开发者将模型无缝集成到各种应用场景中。 通过LangChain,开发者可以更专注于业务逻辑的实现,而不必过多关注底层模型的复杂性。 prompt) print(response.content) 这时我们的langSmith后台: 构建语义搜索引擎  我们使用LangChain的文档加载器、嵌入、向量库来从其他来源检索数据,与模型工作集成 1️⃣根据与字符串查询的相似性返回文档: # 接受一个文本字符串作为输入,并返回与该文本最相似的向量 results = vector_store.similarity_search( "模型的发展和繁荣既是当前 ("模型的发展是顶峰") # 接受一个嵌入向量作为输入,并返回与该向量最相似的向量 results = vector_store.similarity_search_by_vector(embedding

    75931编辑于 2024-12-04
  • 来自专栏开源项目搭建

    简单3步部署本地国产模型DeepSeek模型

    简单3步部署本地国产模型DeepSeek模型DeepSeek是最近非常火的开源模型,国产模型 DeepSeek 凭借其优异的性能和对硬件资源的友好性,受到了众多开发者的关注。 本文将介绍如何通过简单 3 步在本地部署 DeepSeek 模型,让你能够轻松体验这一强大的 AI 工具。 加速技术普及:开源策略让更多的开发者和企业能够接触到先进的AI技术,降低了AI技术的使用门槛,加速其在各个领域的普及。 deepseek-r1的哪个版本的模型? 结束语从环境准备到获取模型文件,再到加载并运行模型,整个过程清晰明了,适合初学者和有一定经验的开发者。

    7.1K33编辑于 2025-02-06
  • 来自专栏周末程序猿

    机器学习|从0开发模型-译llama3-from-scratch

    最近在看一篇github上大佬的文章,从0开始训练llama3,觉得对于《从0开发模型》有点帮助,于是翻译一下,发现其中很多内容当前系列文章的知识点相似。 2、读取模型文件 将模型文件下载到 Meta-Llama-3-8B 文件夹中,然后读取模型文件,代码如下: import torch import json model = torch.load("Meta-Llama scratch 6、构建Transformer第一层 6.1、归一化 获取模型的第一层权重(layer.0),进行归一化处理: llama3-scratch token_embeddings = rms_norm scratch 现在又有了第一层的32个head的qkv_attention矩阵,接下来将所有的注意力分数合并为一个大小为[17x4096]的矩阵,如下所示: stacked_qkv_attention scratch 在llama3中,使用了SwiGLU前馈网络,这种网络架构非常适合在模型需要时添加非线性,如今,在llms中使用这种前馈网络架构相当常见。

    49010编辑于 2025-02-27
  • 1模型应用开发基础

    1、模型应用开发基础 AGI(Artificial General Intelligence)中文译为「通用人工智能」。是具备超越人类智能的 AI。 AGI 时代,AI 无处不在,形成新的社会分层: AI 产品使用者,使用别人开发的 AI 产品 AI 产品制造者,设计和开发 AI 产品 基础模型相关,训练基础模型,或为模型提供基础设施(算力等) 模型 AI 能干什么? 模型,全称「语言模型」,英文「Large Language Model」,缩写「LLM」。 本课第一个专业向要求:分清对话产品和模型。 划重点: 模型就是一个函数,给输入,生成输出 任何可以用语言描述的问题,都可以输入文本给模型,就能生成问题的结果文本 进而,任意数据,都可以输入给模型,生成任意数据 模型是怎样工作的? 这些字之间的概率关系,就是模型训练时学到的。 用不严密但通俗的语言描述原理: 训练: 模型阅读了人类说过的所有的话。

    17210编辑于 2026-06-16
  • 来自专栏AI技术应用

    AI教育模型开发

    代码能力(部分模型): 理解和生成代码,这在编程教育中尤为重要。AI教育模型接入的流程接入AI教育模型通常涉及以下步骤:1.需求分析与场景定义:明确目标: 你希望模型解决教育中的哪些具体问题? 用户群体: 模型将服务于谁?(学生、教师、家长、教研人员)核心功能: 确定模型将扮演的角色和提供的核心功能。 合规性与数据隐私: 确保所选模型和接入方式符合教育行业的法规要求和数据隐私标准。3.技术架构设计:API集成: 大部分情况下,是通过调用模型提供的API接口来实现功能。 通过将模型与一个外部知识库(如课程资料、教材、习题库等)结合,让模型在生成回答前先检索相关信息,从而提高回答的准确性和专业性,解决模型的“幻觉”问题。 4.开发与集成:后端开发: 搭建后端服务,负责处理用户请求、调用模型API、管理数据、实现业务逻辑。前端开发开发用户界面,与后端服务进行交互,展示模型输出。

    1.2K10编辑于 2025-06-18
  • 来自专栏Soul Joy Hub

    模型AIGC系列课程 3-2】国产开源模型:ChatGLM

    GLM https://arxiv.org/pdf/2103.10360.pdf GLM是General Language Model的缩写,是一种通用的语言模型预训练框架。 这个图示说明了GLM预训练的过程,具体解释如下: a) 原始文本:给定一个原始文本,例如[x1, x2, x3, x4, x5, x6]。 在这个例子中,我们随机选择了两个连续的词片段[x3]和[x5, x6]作为样本。 b) 替换和洗牌:在Part A中,我们将被选择的词片段替换为[M](表示遮盖)。 在这个例子中,我们将[x3]和[x5, x6]洗牌为[x5, x6]和[x3]。 c) 自回归生成:GLM使用自回归的方式生成Part B。 在生成过程中,模型可以根据之前生成的词片段和Part A中的上下文来预测下一个词片段。 d) 自注意力掩码:为了限制模型的注意力范围,

    98120编辑于 2023-08-28
  • 来自专栏项目文章

    模型开发教学智能体】:你的专属模型教学助手

    通过这一平台,开发者能够利用文心模型,针对自己的行业和应用场景,选择适合的开发方式,打造具有时代特征的产品。 例如咱们的模型开发教学智能体设定如下: 角色与目标 作为一个模型相关的专家,你的主要任务是解答用户的代码问题,教授机器学习的基础知识,以及解释模型算法。 在解释模型算法时,需要清晰地阐述算法的原理、应用以及优缺点,以便用户能够全面了解。 若用户的问题超出你的知识范围或无法清晰解答,应诚实告知用户,并尝试提供相关的学习资源或建议。 零代码智能体开发体验让我深刻感受到其带来的便利和高效,它不仅降低了技术门槛,还极大提升了开发速度,让开发者能够更专注于业务逻辑的创新和实现。 这种开发模式预示着人工智能应用开发的未来趋势,预示着它将为更多开发者带来无限的便利和机遇,推动智能技术在各行各业的广泛应用和创新。

    1.1K10编辑于 2024-06-07
  • 微软密谋超级AI模型!LangChain带你轻松玩转模型开发

    3和OpenAI的GPT-4等知名模型相匹敌。 在这一背景下,为了帮助开发者更方便、灵活地构建基于语言模型的应用,一批大型模型应用开发框架应运而生,LangChain这个大语言模型时代下的“新星”也应运而生,它不仅让AI应用的开发变得易如反掌,更是从单一的开发框架演变为一个包含开发 在这样一个技术飞速进步的时代,了解并掌握LangChain无疑是每一个AI开发者的必修课。 《LangChain技术解密:构建模型应用的全景指南》一书便可以带你领略大语言模型的应用开发世界! 第3章 深入讲解了模型的输入与输出(Model I/O)中的Model部分,包括LangChain Model的使用方法和最常用的OpenAI API及其参数设置,使读者在实际操作中能够更加精准地控制模型行为 这使得开发人员不仅能够运用那些已极为成熟的资源去构建应用,同时能够借助那些集成的工具,迅速洞悉并尝试语言模型的最新技术。 目前,LangChain已成为进行语言模型应用开发必须掌握的框架之一。

    70510编辑于 2024-05-28
  • 来自专栏openclaw系列

    OpenClaw怎么换模型3步免费切换各种模型配置教程

    一句话总结:OpenClaw 本身不内置任何模型,而是通过灵活的配置机制对接各类模型服务。更换模型只需三步:选择目标模型获取 API Key、在配置文件中添加模型提供商、重启网关生效。 第一章:核心原理——OpenClaw 如何对接模型?1.1 为什么需要更换模型?OpenClaw 的核心价值在于“连接”——连接模型的思考能力与电脑的真实操作权限。 ,适合个人开发者和中小企业测试使用。 DeepSeek 以强大的代码能力和推理能力著称,是开发者的热门选择。 Q3:本地模型响应太慢怎么办?

    27.4K54编辑于 2026-03-28
  • 来自专栏小雨的CSDN

    3. 软件测试——开发模型(瀑布模型,螺旋模型,递增迭代,敏捷开发

    软件工作的范围不仅仅局限在程序编写,而是扩展到了整个软件生命周期; 【软件开发的周期:、需求分析、设计、实现、测试、安装部署、运行维护】 1.瀑布模型 根据上面的图可以看到,瀑布模型的测试就是在整个过程中只出现一次 –风险往往迟至后期的测试阶段才显露,因而失去及早纠正的机会 2.螺旋模型 一般在软件开发初期阶段需求不是很明确时,采用渐进式的开发模式。 螺旋模型是渐进式开发模型的代表之一。 这对于那些规模庞大、复杂度高、风险的项目尤其适合 优点: –强调严格的全过程风险管理 –强调各开发阶段的质量 –提供机会检讨项目是否有价值继续下去 缺点: –引入非常严格的风险识别、风险分析和风险控制 3 每日例会:每天scrum master召集站立会议,团队成员回答昨天做了什么今天计划做什么,有什么问题。

    1.5K20编辑于 2022-10-26
  • 来自专栏程序那些事

    语言模型开发利器langchain

    当然不是,虽然小公司或者个人不能开发底层的语言模型,但是我们可以在语言模型之上进行应用开发,这应该就是我们现在能做到的。 今天给大家介绍一个语言模型开发框架langchain,有了它,在AI的世界,你可以如虎添翼。 什么是langchain 简单来说,langchain是一个基于语言模型只上的开发框架,有了他,我们就可以轻松在各种模型之上进行实际应用的开发。 因为langchain只是一个语言模型上的开发框架,它的所有的能力都是依赖于语言模型的,所以在使用langchain之前,我们需要一个语言模型,最简单同时也是最强大的语言模型就是openai的chatgpt 比如我们现在需要向openai询问昨天的天气,但是openai本身只是一个模型,它并不知道实时的信息。

    87610编辑于 2023-09-06
  • 来自专栏大模型

    模型应用开发基础-Prompt工程

    模型应用开发基础-Prompt工程1. 什么是Prompt?Prompt(提示词)是用户输入给AI模型的指令或问题,用于引导模型生成特定输出。 Prompt工程的定义Prompt工程(Prompt Engineering)是通过优化输入指令的结构、措辞和上下文,使语言模型(LLM)输出更准确、可靠且符合需求的技术。 核心目标: ✅ 减少歧义:明确任务边界,避免模型“自由发挥” ✅ 提高可控性:让AI的输出格式、风格、深度符合预期 ✅ 适配专业场景:针对不同领域(如编程、法律、教育)定制指令 3. 语言模型(如GPT-4、Claude、Gemini)本质是“概率生成器”,它们会根据输入提示猜测用户意图。 最终剩余:4个 不过2023年后发布的主流模型(GPT-4 Turbo、Claude 3、Gemini 1.5)已原生集成思维链推理能力。

    1.2K10编辑于 2025-06-23
  • 来自专栏程序那些事

    语言模型开发利器langchain

    当然不是,虽然小公司或者个人不能开发底层的语言模型,但是我们可以在语言模型之上进行应用开发,这应该就是我们现在能做到的。 今天给大家介绍一个语言模型开发框架langchain,有了它,在AI的世界,你可以如虎添翼。 什么是langchain简单来说,langchain是一个基于语言模型只上的开发框架,有了他,我们就可以轻松在各种模型之上进行实际应用的开发。langchain的主要特点有两个,第一点就是组件化。 因为langchain只是一个语言模型上的开发框架,它的所有的能力都是依赖于语言模型的,所以在使用langchain之前,我们需要一个语言模型,最简单同时也是最强大的语言模型就是openai的chatgpt 比如我们现在需要向openai询问昨天的天气,但是openai本身只是一个模型,它并不知道实时的信息。

    1.1K20编辑于 2023-06-28
  • 来自专栏码农编程进阶笔记

    Java + LangChain 开发语言模型应用!

    在 Baeldung 上看到了一篇介绍基于 Java + LangChain 开发语言模型应用的基础入门文章,写的非常不错,非常适合初学者。于是,我抽空翻译了一下。 1. 大型语言模型 语言模型是自然语言的概率模型,可以生成一系列单词的概率。大型语言模型[3](LLM)则是以其规模庞大而著称,通常包含数十亿参数的人工神经网络。 然后,我们可以使用用户提供的输入在向量数据库中执行语义搜索,并将搜索结果作为附加上下文提供给模型3. 不过,社区开发了 Java 版本 LangChain,称为 LangChain4j[15] ,支持 Java 8 或更高版本,并兼容 Spring Boot 2 和 3。 这些库未来将快速发展,它们会让开发由语言模型驱动的应用程序的过程变得更成熟和有趣!

    3.3K12编辑于 2025-03-29
  • 来自专栏算法channel

    模型开发工程师 roadmap

    模型开发工程师应该是接下来几年最火的方向之一,今天逛github发现一个很好的学习导图,是一个专业的模型开发工程师的学习路线图: 我翻译了一下,供英文不是很好的同学参考: 运行LLMs: LLM engineering) 结构化输出(Structuring outputs) 构建向量存储: 摄入文档(Ingesting documents) 分割文档(Splitting documents) 嵌入模型

    1.1K10编辑于 2024-04-11
  • 3SemanticKernel使用非ChatGPT模型

    SK 目前提供了多个AI 提供商的Connector,但仅OpenAI 和Azure OpenAI 两种Connector(连接器)属于正式可用状态,国内开发者而言并不能访问国外模型,因此如何使用国内模型 使用代理,诸如OneApi 自行实现 Connectors 注册智谱模型 北京智谱华章科技有限公司(简称“智谱AI”)致力于打造新一代认知智能模型,专注于做大模型的中国创新。 打造了AIGC模型及产品矩阵,包括通用模型、超拟人大模型、图像模型、向量大模型等,并且支持使用您的私有数据对模型进行微调。 ; response.Display(); 使用OneApi 对接流行模型 OneApi 是一个GitHub 开源项目,帮助开发者通过标准的 OpenAI API 格式访问所有的模型。 (https://github.com/songquanpeng/one-api) 借助OneApi,开发者可以忽略模型间的API 差异,通过统一的OpenAI的格式,实现对各大模型的透明调用。

    21110编辑于 2026-06-17
  • 来自专栏大模型成长之路

    模型学习 | DeepSeek-V3原理】

    DeepSeek-V3 Technical Report DeepSeek-V3 的基本框架还是 Transformer。 另外,V3 模型是通过将预测多token作为训练目标。本文主要是对DeepSeek-V3模型框架以及训练目标进行讨论。 什么是负载平衡? 2️⃣ DeepSeekMoE 在Transformer架构中的FFN层,V3模型采用了MoE进行替换,使用更细粒度的专家,并将一些专家隔离为共享专家。 ✅ Yes ✅ 无偏置 目前的模型权重已开源: https://huggingface.co/deepseek-ai/DeepSeek-V3-Base 者由于设备限制无法对 V3模型进行体验。

    1.7K21编辑于 2025-07-25
  • 来自专栏AI工程落地

    语言模型--Llama3新特性

    更大的词表使得模型涵盖的语言更多、更加通用 Attention层--MultiHeadAttention算子 Llama3 8B和70B都使用了分组查询注意力机制(GQA),4个Query共享一对Key 减少了计算量,同时保持了模型的性能。 值是500000.0(Llama2用的是默认值10000.0) 上下文窗口中的最大Tokens从 4096增加到 8192 数据类型 Llama2开源的参数是float16格式的,但Llama3开源的参数都是 依赖软件包 transformers包升级到4.40.0以上 模型版本 2024年4月21号 初版 Llama3 8B的HellaSwag分数:acc 0.6039、acc_norm 0.776 2024年5月14号 第二版 Llama3 8B的HellaSwag分数:acc_norm 0.822

    44010编辑于 2024-05-29
领券