首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏NLP/KG

    语义检索-BAAI Embedding语义向量模型深度解析:微调Cross-Encoder以提升语义检索精度

    语义检索-BAAI Embedding语义向量模型深度解析:微调Cross-Encoder以提升语义检索精度 语义向量模型(Embedding Model)已经被广泛应用于搜索、推荐、数据挖掘等重要领域 然而,当前中文世界的高质量语义向量模型仍比较稀缺,且很少开源 BGE 出色的语义表征能力源于两方面要素:1)针对表征的预训练,2)大规模文本对训练。 BGE 在悟道 、Pile 两个大规模语料集上采取了针对表征的预训练算法 RetroMAE :将低掩码率的输入编码为语义向量(Embed),再将高掩码率的输入与语义向量拼接以重建原始输入。 这样一来,BGE 得以利用无标签语料实现语言模型基座对语义表征任务的适配。 65K的负样本规模,增强了语义向量的判别能力。

    1.3K10编辑于 2024-07-09
  • 来自专栏架构进阶

    Postgresql中的检索:中文分词及语义检索

    一 前言     在上一篇文章中提到,在postgresql中,使用pgvector可以实现向量存储和检索,使用pg_trgm基于三元组文本模糊匹配和相似度计算,结合GIN 索引和GiST索引实现全文检索 但pg_trgm并不是一个专业的中文分词工具,它是基于字符层面的处理,不理解语义。 zhparser等分词插件的情况下,执行SELECT show_trgm('中文测试');时会发现结果为空,因此需要结合zhparser、jiebaR,或使用ElasticSearch等插件或工具实现中文分词/全文检索

    1.6K00编辑于 2025-06-23
  • 来自专栏Reinvent Data Science

    Milvus x Lucidworks 快速构建语义检索

    语义检索 [1](Semantic Search) 是能帮助你的客户或员工找到正确的产品或信息的绝佳工具,它甚至可以检索到一些难以被索引的信息,从而获得更好的结果。 如果低效的语义检索难以胜任,那么如何进行高速的语义检索呢? 幸运的是,Lucidworks 热衷于解决此类问题。 执行语义检索 为了让机器学习达到闪电般快的速度,Lucidworks 通过向量搜索的方法执行语义检索,由两个关键部分组成。 第一部分:机器学习模型 首先,你需要将文本编码为特征向量。 使用语义检索 在了解了 Milvus 如此重要的原因后,让我们回到语义检索的工作流程。 语义检索分为三个阶段:第一阶段是加载和/或训练机器学习模型;接着,将数据导入到 Milvus 和 Solr 中并建立索引;最后是查询阶段,即实际搜索发生的阶段。下面将重点介绍后两个阶段。

    1.2K40发布于 2021-06-25
  • 来自专栏AI SPPECH

    Search Engine:全库搜索与语义检索

    本文讲解Search Engine的实现:全文索引、语义向量检索、查询解析器、搜索结果ranking、以及如何将传统搜索与AI搜索融合,提供更精准的检索结果。 语义搜索:向量嵌入与近似最近邻检索 3.1 从关键词到语义的跨越 3.2 代码嵌入的特殊性 3.3 向量检索的工程实现 3.4 混合检索架构 4. 它将文本映射到高维向量空间,使语义相似的代码片段在向量空间中彼此接近。即使变量名完全不同,只要功能语义相同,就能被检索到。 语义搜索:向量嵌入与近似最近邻检索 3.1 从关键词到语义的跨越 语义搜索的核心思想是将查询和文档都映射到高维向量空间,通过向量距离衡量语义相似度。 现代搜索系统通常将语义搜索与传统搜索结合,形成混合检索架构: 分数融合策略是混合检索的核心。

    37211编辑于 2026-06-02
  • 来自专栏NLP/KG

    语义检索系统:基于无监督预训练语义索引召回:SimCSE、Diffcse

    1.2 评估指标 (1)采用 Recall@1,Recall@5 ,Recall@10 ,Recall@20 和 Recall@50 指标来评估语义索引模型的召回效果。 它还具有可调整参数,可以根据需要来优化精度和速度之间的平衡,例如一次查询返回的最大邻居数、检索阈值等。 由于Hnswlib不依赖于任何特定类型的特征或数据格式,因此它可以应用于各种任务,例如图像检索、自然语言处理等。 DiffCSE 模型同样适合缺乏监督数据,但是又有大量无监督数据的匹配和检索场景。 DiffCSE 模型同样适合缺乏监督数据,但是又有大量无监督数据的匹配和检索场景。

    1.7K00编辑于 2023-08-02
  • 来自专栏NewBeeNLP

    语义信息检索中的预训练模型

    检索模型的分类 检索的核心,在于计算query和document的 相似度 。 依此可以把信息检索模型分为如下三类: 基于统计的检索模型 使用exact-match来衡量<query,document>相似度,考虑的因素有query中的词语在document中出现的词频TF、document 基于exact-match的检索模型是召回中必不可少的一路。 其实,在现在常用的深度检索模型中也经常增加这种人工构造的特征。 例如,可以对T5在query-document对上做微调,然后对每个document做文本生成,来生成对应的query,再加到document中。

    2.5K10编辑于 2022-11-11
  • 来自专栏NewBeeNLP

    BM25 比语义向量检索效果好?

    NewBeeNLP公众号原创出品 公众号专栏作者 @Maple小七 北京邮电大学·模式识别与智能系统 TL;DR 虽然以SentenceBERT为代表的语义向量检索展现出了超越传统的以 然而现实世界并不会这么理想,稀疏向量查询通常会存在棘手的词汇空缺或语义鸿沟问题(lexical/semantic gap)。 「语义鸿沟」可以理解为是自然语言词汇的稀疏性和语法的多样性,这些现象可以通过同义词典、句式变换等方式来改善。 这正是稠密向量查询想要达到的效果,也就是将查询和文档映射到同一个低维向量空间,通过计算余弦相似度来检索相关文档,关于稠密向量表示的探索可以追溯到经典的潜在语义分析(LSA),2013年的DSSM首次将深度学习方法引入了稠密向量检索 ,目前,以SentenceBERT为代表的语义检索模型在很多数据集上超越了基于稀疏向量的检索方法。

    3.2K20发布于 2021-06-25
  • 来自专栏NewBeeNLP

    语义信息检索中的预训练模型(下)

    语义信息检索中的预训练模型 这一篇将介绍预训练模型在深度召回和精排中的应用。 4. 所以,应该设计专门针对检索任务的预训练任务。 5. 预训练模型在精排中的应用 精排阶段可以是多个cascading模型级联构成,数据量越来越少、模型越来越复杂。 3) CEDR (CEDR: Contextualized Embeddings for Document Ranking[5] ) 先使用BERT获得query和document中每个词的上下文表征 /pdf/1910.14424.pdf [4] https://arxiv.org/pdf/1910.14424.pdf: https://arxiv.org/pdf/1910.14424.pdf [5]

    2.6K30编辑于 2022-11-11
  • HTML5 语义元素

    语义= 意义 语义元素 = 有意义的元素 什么是语义元素? 一个语义元素能够清楚的描述其意义给浏览器和开发者。 无语义 元素实例:

    - 无需考虑内容. 语义元素实例: <form>, , and - 清楚的定义了它的内容. HTML5中新的语义元素 许多现有网站都包含以下HTML代码:
    ,
    , 或者
    , 来指明导航链接, HTML5 提供了新的语义元素来明确一个Web页面的不同部分:
    39010编辑于 2025-12-16
  • 来自专栏用户6884826的专栏

    html5语义元素

    HTML5 添加了很多语义元素如下所示: 标签 描述

    定义页面独立的内容区域。
    1.4K20发布于 2021-07-07
  • 来自专栏IT云清

    5.Elasticsearch检索文档

    我们会发现,我们存储的文档,在_source中,其他的类似_index,_type等都是元数据,元数据在后面会做详细解释。

    71520发布于 2019-01-22
  • 来自专栏网罗开发

    大模型如何提升信息检索效率:语义检索与向量数据库的结合

    通过引入大模型的语义理解能力,检索系统能够更好地理解用户意图,而向量数据库则能够高效地存储和检索高维向量数据。本文还提供了一个可运行的示例 Demo 代码模块,展示了如何在实际应用中实现语义检索。 这些模型能够理解文本的语义,从而提升信息检索的效率和准确性。本文将介绍如何利用大模型实现语义检索,并结合向量数据库优化检索效率。 语义检索的实现大模型的语义理解能力大模型(如BERT、GPT等)通过预训练和微调,能够理解文本的语义语义检索的流程语义检索的流程通常包括以下几个步骤:查询理解:利用大模型对用户查询进行语义理解,生成查询向量。文档编码:利用大模型对文档库中的文档进行编码,生成文档向量。 通过引入大模型的语义理解能力,检索系统能够更好地理解用户意图,而向量数据库则能够高效地存储和检索高维向量数据。本文还提供了一个可运行的示例代码模块,展示了如何在实际应用中实现语义检索

    1.9K10编辑于 2025-03-04
  • 来自专栏网络收集

    html5语义

    rel="shortcut icon" type="image/x-icon" href="images/favicon.ico"/> </head> <body> </body> </html> 5、 其实,学习HTML的重点不在于掌握了多少标签,而是在于掌握标签的语义 以及如何编写一个语义结构良好的页面。 在实际开发过程中,很多人由于对标签语义不熟悉,常常用某一个标签代替另外一个标 签来实现某些效果。 举例: <! HTML的精髓就在于标签的语义。 在HTML中,大部分标签都有它自身的语义,例如p标签,表示的是"paragraph",标记的是一个段落;hl标签,表示“headerl”,标记的是一 个最高级标题……而div和span是无语义的标签,我们应该尽可能少用

    79430编辑于 2022-05-18
  • 来自专栏NLP/KG

    语义检索系统:基于Milvus 搭建召回系统抽取向量进行检索,加速索引

    语义检索系统:基于Milvus 搭建召回系统抽取向量进行检索,加速索引 目标:使用 Milvus 搭建召回系统,然后使用训练好的语义索引模型,抽取向量,插入到 Milvus 中,然后进行检索。 向量检索 5.1 基于Milvus的向量检索系统搭建 数据准备结束以后,开始搭建 Milvus 的语义检索引擎,用于语义向量的快速检索,使用Milvus开源工具进行召回,Milvus 的搭建教程请参考官方教程 参考项目,导出自己的静态图模型:语义检索系统:基于in-batch Negatives策略的有监督训练语义召回 数据量 显卡 时间 1000万条 V100 32GB 3h41min 1000万条 A100 针对第三个问题:Milvus只起到加速的效果,这个跟模型相关,并且关键字匹配不推荐使用语义检索,如果是句子级别的匹配,使用语义检索更合适;推荐进行双路召回【语义+关键字】 进入重点如何启动milvus向量库以及涉及到 图片 图片 6.FAQ 6.1 抽取文本语义向量后,利用 Milvus 进行 ANN 检索查询到了完全相同的文本,但是计算出的距离为什么不是 0?

    3.8K00编辑于 2023-08-02
  • 来自专栏AI算法之心

    京东电商搜索中的语义检索与商品排序

    文章作者:王松林、唐国瑜 京东算法工程师 编辑整理:Hoh 内容来源:作者授权 出品平台:DataFunTalk 导读:本文将介绍京东搜索场景中的两块技术,语义检索与商品排序。 如下图所示,不同的 head 可以捕获 query 不同的语义 ( query=苹果,语义可以是手机和水果 ),捕获不同的品牌属性 ( query=手机,品牌可以是华为、小米 ),捕获不同的产品属性 ( 模型 servable 服务,我们将向量检索和 tfs 合成一个服务,不仅减少一次网络访问,降低系统 3-5ms 的平响,而且将模型分片部署,从而可以支持上百个模型同时服务或者 A/B 实验。 语义检索效果展示 语义检索上线后获得了很好的体验效果,不仅提升了转化,长尾流量降低了近10%的 query 改写率,也就是说用户不需要多次改写 query,就能获得想要的商品结果。 ? 04 总结 我们介绍了语义检索召回和商品排序,在京东搜索服务上部署并取得了良好效果。我们还在尝试一些业内其他流行的方法,比如 GNN、KG、MMoE 等方向,也获得了不错的成绩。

    1.8K20发布于 2020-06-09
  • 来自专栏大数据钻研

    HTML5 语义化 - main

    使用   就像其它的 HTML5 新元素一样,并不是所有的浏览器都能够识别出 <main> ,并且给它加上预设的样式,你可能需要在自己的 CSS 文件中将它设置为块级元素。 <script type="text/javascript">document.createElement('main');</script>   当然了,你还可以使用 html5shiv.    main id="content">Main Content</main>

    Footer
      好了,这是如此的简单,以至于一分钟不到我们就可以将文档改写成新潮的 HTML5

    95660发布于 2018-04-18
  • 来自专栏Micro_awake web

    HTML5语义化元素

    语义化元素:有意义的元素。 对语义化的理解: 正确的标签做正确的事情; HTML5语义化元素让页面内容结构化清晰; 便于开发人员阅读,理解,维护; 搜索引擎爬虫可以依赖语义化元素来确定上下文和每个关键字权重,利于SEO。

    2
    3
    而现在,我们可以使用语义化元素 DOCTYPE html> 2 <html lang="en"> 3 <head> 4 <meta charset="UTF-8"> 5 <meta name="viewport initial-scale=1.0"> 6 <meta http-equiv="X-UA-Compatible" content="ie=edge"> 7 <title>html5<

    1.7K50发布于 2018-01-11
  • 来自专栏火属性小虫

    HTML5语义化标签

    , 23 2月 2021 作者 847954981@qq.com 说明补充 HTML5语义化标签 HTML5的一大特性就是标签语义化,即标签名代表各自的用处。 图片 <!

    1.9K20编辑于 2023-02-22
  • 来自专栏Web前端知识点概要

    HTML5语义化结构标签

    HTML5中的header元素是一种具有引导和导航作用的结构元素,该元素可以包含所有通常放在页面头部的内容。其基本语法格式如下:

    网页主题

    ... nav元素用于定义导航链接,是HTML5新增的元素,该元素可以具有导航性质的链接归纳在一区域中,使页面元素的语义给家准确,主要用于传统导航条、侧边栏导航、页内导航、翻页导航。 在HTML5出现之前,一般使用
    标记来定义页面底部,而通过HTML5的footer元素可以轻松实现。 文本层次语义元素 1.time元素 time元素用于定义时间或日期,可以代表24小时中的某一时间。 time元素有两个属性: datetime:用于定义相应时间或日期。 2.hidden属性 在HTML5中,大多数元素都支持hidden属性,该属性有两个属性值:true和false。当hidden属性取值为true时,元素将会被隐藏,反之则会显示。

    3.1K11发布于 2020-03-03
  • 来自专栏韩曙亮的移动开发专栏

    【HTML5】HTML5 语义化标签 ( HTML5 简介 | 新增特性 | 语义化标签及代码示例 )

    一、HTML5 简介 ---- HTML5 指的是 对 HTML 语言的第五次重大修改 , 新增了新的元素 / 属性 / 行为 ; HTML5 新增的特性 : 语义特性 本地存储特性 设备兼容特性 连接特性 非常适用于移动端开发 ; 二、HTML5 语义化标签 ---- 传统发那个是 , 使用 div 进行布局 , 搜索引擎不知道这个盒子是做什么的 ; HTML5 新增加了如下语义化标签 : 头部标签 : , nav, article, section, footer { /* 兼容 IE9 不识别 HTML5 语义化标签问题 */ display: block; } 三、HTML5 语义化标签代码示例 ---- 代码示例 : <! { /* 兼容 IE9 不识别 HTML5 语义化标签问题 */ display: block; width: 100%;

    3.3K30编辑于 2023-04-24
  • 领券