首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏悠扬前奏的博客

    Pandas-11. 文本操作

    Pandas-11. 文本操作 以如下代码作为例子: s = pd.Series(['Tom ', ' William Rick', 'John', 'Alber@t']) lower() 将Series/Index中的字符串转换为小写

    62730发布于 2019-05-29
  • 来自专栏分布式|微服务|性能优化|并发编程|源码分析

    11.ES索引模版使用

    索引模版能干什么 Elasticsearch 索引模板(Index Template)是一种用于自动创建和管理索引的模板,它允许你在创建新索引时自动应用一组预定义的设置和映射规则。 索引模板通常用于定义一组共享的索引设置,确保新创建的索引具有一致的结构和配置。 索引模板的主要目的是在索引创建时自动应用一组规则,而无需手动干预或重复定义设置。 这对于拥有多个类似结构的索引非常有用,例如日志索引、时间序列索引等。 使用索引模版 创建索引模版 在这个模版中,预定义了以下内容 设置分片数量和副本数量 约定共用字段和字段类型 指向同一别名 模版匹配条件是:以lglbc-template-log开头的都会使用这个模版 priority ":"2023-10-11 23:00:00", "url":"/login", "method":"post" } 加入一条数据后,我们获取下这个索引的信息 GET lglbc-template-log

    64310编辑于 2023-12-14
  • 来自专栏爬蜥的学习之旅

    文本获取和搜索引擎简介

    根据句法本身去推断为什么这样做,理解为什么有人这样描述,比如可能是想让某人把狗唤回来,以免男孩被狗伤着 Bag of words:保留所有的单词,重复的也会保留,但是不关心单词在生个句子中出现的顺序 文本获取的分类 类似搜索引擎的Pull模型:用户拥有主动权,它具有Ad hoc属性,就是说暂时性的需要,后续不再使用,比如搜索到某个关键字的文档后,这个关键字就不再被使用 查询和浏览的区别:查询是用户知道搜索什么, 浏览是将内容放置供人查看,而不是查询 类似推荐系统的Push模型:系统拥有主动权,一个良好的推荐系统能够给用户推送它真正需要的信息 文本获取的方式 用户给定查询关键字在既有的数据集里头搜索出想要的结果以供浏览 文本获取的方式一般有两种: 第一是 document selection,即根据某种函数f给查询q和文件d作用后的结果来分类,[f(q,d)=1 / 0],明确把文档分隔开,要么完全相关,要么完全不相关 ; 第二是 Ranking,它是计算相关性,并依次排列顺序,关键在于如何说明某个文件的相关性比另一个的相关性更大,当相关性大于某个阈值的时候就返回匹配的文件[ f(q,d)>THETA] 文本获取(Text

    1K30发布于 2019-07-09
  • 来自专栏呼延

    Lucene系列(11)索引格式之pay文件

    其中的字段解释: IndexHeader: 索引头 Term: 一个term的位置信息 Footer: 索引尾. ---- PackedIntBlock 一整个块(128个Doc)的payload/offset

    1.1K10发布于 2021-03-15
  • 来自专栏机器学习算法原理与实践

    文本主题模型之潜在语义索引(LSI)

        在文本挖掘中,主题模型是比较特殊的一块,它的思想不同于我们常用的机器学习算法,因此这里我们需要专门来总结文本主题模型的算法。本文关注于潜在语义索引算法(LSI)的原理。 1. 潜在语义索引(LSI)概述     潜在语义索引(Latent Semantic Indexing,以下简称LSI),有的文章也叫Latent Semantic  Analysis(LSA)。 image.png     如果把上式用到我们的主题模型,则SVD可以这样解释:我们输入的有m个文本,每个文本有n个词。 也可以反过来解释:我们输入的有m个词,对应n个文本。而$A_{ij}$则对应第i个词档的第j个文本的特征值,这里最常用的是基于预处理后的标准化TF-IDF值。k是我们假设的主题数,一般要比文本数少。 LSI用于文本相似度计算     在上面我们通过LSI得到的文本主题矩阵可以用于文本相似度计算。而计算方法一般是通过余弦相似度。比如对于上面的三文档两主题的例子。

    1.8K20发布于 2018-08-07
  • 来自专栏让技术和时代并行

    lucene给文本索引和搜索功能的应用

    lucene允许你往程序中添加搜索功能,lucene能够把你从文本中解析出来的数据进行索引和搜索 ,lucene不关心数据来源 甚至不关心语种,不过你需要把它转换成文本格式。 也就是说你可以搜索 html网页,文本文档,word文档 ,pdf,或者其他一些 总之 只要能够提取出文本信息的即可。 , 而每个field相当于我们的表名 ,它能够对文本进行自动处理去掉里面的一些语气词,它能把你规定的域当作关键词来进行索引 以备查询时使用,lucene比较容易使用 ,但是不如数据库灵活,速度很快。 list.add(doc.get("contents")); } reader.close(); return list; } } //这里我主要给文档中的文本进行添加了索引 ,你也可以在Field 中给路径 等等一些属性进行添加索引   具体你可以搜索lucene api 进行使用 里面的一些方法。

    1.1K30发布于 2019-04-16
  • 来自专栏爬蜥的学习之旅

    文本获取和搜索引擎的概率模型

    coursera课程 text retrieval and search engine 第四周 推荐。

    1.4K30发布于 2019-07-09
  • 来自专栏爬蜥的学习之旅

    文本获取和搜索引擎之推荐系统

    推荐系统即把恰当的内容推送给用户,类似于在一系列文档中过滤出用户想要的。一般有两种方式:

    80631发布于 2019-07-09
  • 来自专栏agent平台

    《Spring ES实战》第11索引怎么安全升级

    旧数据还在,新写入却进不来,索引状态变成了黄灯。深夜告警声催人醒,索引字段改不成。回滚按钮在发抖,数据一半新一半旧。 Lucene的倒排索引里。 倒排索引已固化,改字段是镜中花。新索引里重建数据,别名一换流量达。 11、小结展开代码语言:TXTAI代码解释三问三答:为什么不能启动时改→因为不可变且不追溯;怎么选→新索引+重建+Alias;选错后果→写入失败、查询分裂、回滚不干净第一问:为什么生产环境不能让应用启动时随意创建和修改核心索引 因为Reindex是把文档从源索引拷贝到目标索引,目标索引按新Mapping重新分词建倒排。旧索引的倒排索引没有变化,查询旧索引仍然按旧分词器命中。

    11421编辑于 2026-09-08
  • MySQL 中的全文索引:强大的文本搜索利器

    一、什么是全文索引?全文索引是一种特殊类型的索引,它允许我们在文本字段中进行快速的全文搜索。 与传统的索引不同,全文索引不是基于特定的列值进行索引,而是对文本内容进行分析和索引,以便能够快速地找到包含特定关键词的记录。 二、全文索引的工作原理 文本分析 当我们在 MySQL 表中创建全文索引时,MySQL 会对被索引文本字段进行分析。 经过分析后的文本被存储在全文索引中,以便后续的搜索操作。 索引构建 在分析完文本后,MySQL 会构建全文索引。全文索引通常是一种倒排索引结构,它将每个单词与包含该单词的记录列表相关联。 MySQL 中的全文索引是一种非常强大的功能,它可以帮助我们在大量文本数据中进行快速的全文搜索。

    1.7K00编辑于 2025-02-17
  • 来自专栏Python工程师

    【项目实战】自监控-11-DataFrame索引操作(下篇)

    _64 编辑器:pycharm-community-2016.3.2 这个系列主要是实际在做项目的一个笔记 自监控项目,主要是对采集的质量监控数据做的一个实时预警 今天讲讲对DataFrame的行列索引重排序 通过字典构建DataFrame,它的列已经默认排序好了 为了体现后续的排序效果,额外增加了一列 import pandas as pddict1 = {"e": [1, 2, 3, 4], "c": [11 2 索引排序 Part 2:根据索引排序 sort_index(axis=0, ascending=True)可以选择对行索引排序还是列索引排序 axis=0对行索引排序 axis=1对列索引排序 ascending 3 索引输出 Part 3:将索引转化为列表输出 使用tolist()函数将索引直接转化为列表 df.index.values也可以得到索引对应的值,但是类型依然是numpy.ndarray ind

    65420发布于 2019-10-23
  • 来自专栏agent平台

    《Spring Mongo实战》第11索引跟着查询走

    单字段索引适合只有一个字段过滤的查询;Compound复合索引适合多字段组合过滤,这是最常用也最容易建错的一类;Multikey多键索引解决数组字段内元素查询;Text文本索引处理全文搜索;Geo地理空间索引处理坐标距离 文本索引和地理索引有自己专门的存储结构,分别用于倒排索引和二维球面坐标。 另一个洞见是:索引数量不是能力,而是债务。每个索引都是写路径上的税。一个查询能用一个复合索引解决,就不要建三个单字段索引。把查询模式沉淀成索引资产,比堆积索引聪明得多。 单字段、复合、多键、文本、地理、通配和CoveredQuery是不同工具,但复合索引的ESR顺序决定成败。每个索引都会增加写成本,所以索引越多写入越慢。 Multikey多键索引:针对数组字段的索引,会为数组每个元素创建一个索引条目。Text文本索引:用于全文搜索,基于倒排索引实现。Geo地理空间索引:用于地理坐标查询,支持2dsphere等类型。

    12321编辑于 2026-09-05
  • 来自专栏爬蜥的学习之旅

    文本获取和搜索引擎中的反馈模型

    coursera课程 text retrieval and search engine 第五周 推荐。

    2.5K30发布于 2019-07-09
  • 来自专栏AI SPPECH

    11_文本总结实战:用LLM浓缩长文章

    本文将带您深入了解文本摘要的核心概念、技术原理以及实战应用,重点介绍BART模型在文本摘要任务中的应用,并通过丰富的代码示例展示如何实现高效的文本摘要系统。 一、文本摘要基础 1.1 文本摘要的定义与类型 文本摘要是指将一篇或多篇文档转换为简短、连贯且包含原文档主要信息的摘要文本的过程。 Transformer,能够捕获输入文本的完整上下文信息 自回归解码器:解码器部分采用自回归方式生成文本,确保输出的连贯性 文本损坏预训练:在预训练阶段,模型通过多种方式损坏输入文本(如掩码 四、长文本处理技术 4.1 长文本处理的挑战与解决方案 在实际应用中,我们经常需要处理超出模型上下文窗口长度的长文本。 =0.3, detail_compression=0.7): """ 对文本进行分层压缩,关键部分保留更多细节 key_sections: 关键部分的列表,如段落索引或关键词

    1.5K11编辑于 2025-11-13
  • 来自专栏沈唁志

    文本处理,第2部分:OH,倒排索引

    这是我的文本处理系列的第二部分。在这篇博客中,我们将研究如何将文本文档存储在可以通过查询轻松检索的表单中。我将使用流行的开源Apache Lucene索引进行说明。 系统中有两个主要的处理流程... 文档索引:给定一个文档,将其添加到索引中 文档检索:给定查询,从索引中检索最相关的文档。 下图说明了这是如何在Lucene中完成的。 p1.png 指数结构 文档和查询都以一句话表示。 为了控制文档在其包含字段中的索引方式,可以用多种方式声明一个字段,以指定是否应该分析它(索引期间的预处理步骤),索引(参与索引)还是存储(如果是它需要在查询结果中返回)。 关键字(未分析,索引,存储) 未编入索引(未分析,未索引,已存储) 未存储(分析,索引,未存储) 文本(分析,索引,存储) 倒排索引是存储的核心数据结构。 (这可以使Web API检索某些文本输出,抓取网页或接收HTTP文档上载)。这可以以批处理或在线方式完成。当索引处理开始时,它解析每个原始文档并分析其文本内容。典型的步骤包括...

    3K40发布于 2018-06-04
  • 来自专栏ShowMeAI研究中心

    带你快速构建基础文本索引擎 ⛵

    图片本文使用tf-idf(词频-逆文件频率)、lsi(潜在语义索引)和 doc2vec(文档向量化嵌入)这3种最基础的NLP文档嵌入技术,对文本进行嵌入操作(即构建语义向量)并完成比对检索,构建一个基础版的文本索引擎 (即构建语义向量)并完成比对检索,完成一个基础版的文本索引擎。 图片 文档嵌入技术文档嵌入(doc embedding)方法能完成文本的向量化表示,我们可以进而将文本搜索问题简化为计算向量之间相似性的问题。 我们把『搜索词条』和『文档』都转换为向量(同一个向量空间中)之后,文本比较与检索变得容易得多。图片搜索引擎根据『文档』与『搜索词条』的相似度对文档进行评分与排序,并返回得分最高的文档。 几行代码就可以构建一个基于 tfidf 的原始搜索引擎。

    1.1K41编辑于 2022-08-26
  • 来自专栏NebulaGraph 技术文章

    Nebula 基于 ElasticSearch 的全文搜索引擎的文本搜索

    [Nebula 基于全文搜索引擎的文本搜索] 1 背景 Nebula 2.0 中已经支持了基于外部全文搜索引擎的文本查询功能。 另外,如果将 Nebula 索引的存储模型设计为适合文本搜索的倒排索引模型,那将背离 Nebula 索引初始的设计原则。 2 目标 2.1 功能 2.0 版本我们只对 LOOKUP 支持了文本搜索功能。也就是说基于 Nebula 的内部索引,借助第三方全文搜索引擎来完成 LOOKUP 的文本搜索功能。 数据查询性能:刚刚我们提到了,如果不借助第三方全文搜索引擎,Nebula 的文本搜索将是一场噩梦。 4.3 查询逻辑 [Nebula 基于全文搜索引擎的文本搜索] 由上图可知,其文本搜索的关键步骤是 “Send Fulltext Scan Request” → "Fulltext Cluster" →

    1.8K00发布于 2021-06-17
  • 来自专栏半旧的技术栈

    Mysql进阶索引篇03——2个新特性,11+7条设计原则教你创建索引

    全文索引 利用分词技术等多种算法计算出文本中关键字出现的频率和重要性,是当前搜索引擎的关键技术,非常适合与大型的数据集,比如长文本。通过关键字FULLTEXT进行设置。 age INT NOT NULL, info VARCHAR(255), FULLTEXT INDEX futxt_idx_info(info) ) ENGINE=MyISAM; 可以限定对于文本信息建立全文索引的范围 11种情况 3.1 数据准备 准备下数据。 11种情况 下面适合创建索引的情况都是从B+树数据结构上来考虑的,该专栏前面的文章,已经介绍过B+树。 拓展:Alibaba《Java开发手册》 【 强制 】在 varchar 字段上建立索引时,必须指定索引长度,没必要对全字段建立索引,根据实际文本区分度决定索引长度。

    1.9K20编辑于 2022-10-26
  • 来自专栏爬蜥的学习之旅

    文本获取与搜索引擎中的TF,TF-IDF

    这样看来,需要更好的方式来对长文本做出”惩罚”。另外需要考虑到的是,长文档可能存在两种情况,1是仅仅用了过多的词,2是有很多描述主题的内容,这是不希望有惩罚的。 这里b是一个变量,当b=0,文档长度被忽略,当b非0,|d|(文档长度)越大,权值反而越小,也就得到了”惩罚”长文档的目的,当文档太短时,如果包含查询关键字,很有可能主题就是这些,起到适当的激励作用 文本获取 (TR)的一般架构 tokenization:词提取,确定好词的边界,把相近意思的词映射到同一个 index :将文档转换成易于检索的数据结构,一般使用倒排索引(用一个字典存储文档的部分统计信息,比如当前词一共出现在了多少个文档

    82410编辑于 2024-02-05
  • 来自专栏林雍岷

    在ROBOTS文本设置SITEMAP路径并提交到搜索引

    在ROBOTS TXT文本设置XML网站地图路径很重要,这将有利于谷歌轻松地找到你的网站地图,并加快搜索引擎编制索引网站的速度。 这讲将介绍如何把sitemap.xm文本映射到robots.txt文件,再把网站地图信息PING到搜索引擎。 提交网站地图到搜索引擎 将网站地图添加到robots.txt可让谷歌和其它机器人轻松找到抓取网站地图的方法,否则你需要在每次更新时提交更新内容。 下面介绍使用PING的方法提交网站地图到搜索引擎,告诉搜索引擎我的网站地图已经改变。 sitemap=http://你的网站地图路径.com/sitemap.xml 下图是提交林雍岷博客网站地图 使用PING的方法提交网站地图到搜索引擎绝对不能够代替通过网站管理员控制台提交给搜索引擎的方法

    2.5K40发布于 2019-07-03
领券