搜索 - 腾讯云开发者社区-腾讯云

文章/答案/技术大牛

发布

来自专栏python3
Python文本去重
用法：命令行python unique.py -f file.txt 输出：去除重复字符后的output.txt # -*- coding:utf-8 -*- #auther_cclarence_2016 the characters from optparse import OptionParser import sys reload(sys) sys.setdefaultencoding("utf-8"
3K10发布于 2020-01-06
来自专栏C++打怪之路
排序8: 计数排序
排序思想 2. 图解 3. 代码实现 3.1 逻辑 4. 特性总结 ---- 1. 排序思想计数排序又称为鸽巢原理，是对哈希直接定址法的变形应用。操作步骤： 1. 我们统计完所有数字出现的次数之后，根据次数将数字填入到原数组中，就完成了排序。这种数字对应下标的叫做绝对映射。 c、排序（将统计好的数字放到数组）：我们遍历一遍排好的数组，次数大于1的数字（这里取到的数字需要重新加上min）按次数放到原数组中。计数排序在数据范围集中时，效率很高，但是适用范围及场景有限。 2. 时间复杂度： O(MAX(N, 范围 )) 3.
48020编辑于 2023-03-31
来自专栏Spark学习技巧
面试|海量文本去重~simhash
simhash算法是google发明的，专门用于海量文本去重的需求，所以在这里记录一下simhash工程化落地问题。下面我说的都是工程化落地步骤，不仅仅是理论。结巴分词支持加载IDF词典并且提供了一个默认的词典，它包含了大量的词组以及基于海量文本统计出来的IDF词频，基本可以拿来即用，除非你想自己去挖掘这样一个字典。判重假设有一个新的simhash希望判重，它的simhash值是： a=0000000000000000,b=000000001111110,c=1111111100000001,d=111111111111110 rowkey设计：4字节的segment+1字节的段标识flag+8字节的simhash。切4段，索引一段需要16比特；切5段，索引2段需要13+13比特；所以用4字节的segments来存段落。 1字节的抽屉标识，比如是切4段则标识是1,2,3,4；切5段则可以是1,2,3,4,5,6,7,8,9,10，分别代表(a,b)，(a,c)，(a,d)，(a,e)，(b,c) … 然后最后追加上simhash
3.3K30发布于 2018-12-28
来自专栏Spark学习技巧
面试|海量文本去重～minhash
比如网页去重、推断帖子是否相似、推荐系统衡量物品或者用户的相似度等等。当数据量大的时候，计算的时间和空间复杂度就会是一个很重要的问题，比如在推断相似发帖的时候。我们能够用kmeans来进行聚类。
3.1K30发布于 2018-12-28
来自专栏Laikee Tech Space
layui 异步数据排序重加载
//console.log(obj.type); //当前排序类型：desc（降序）、asc（升序）、null（空对象，默认排序） //console.log( this); //当前排序的 th 对象 //type 0 积分降序 1积分升序 2邀请数降序 3邀请数升序 // if(obj.field { type=""; } } if(obj.field=="invitenum"){ //积分排序 //console.log(type); 　　　　　　table.reload('userList-table', { 　　　　　　 initSort: obj, //记录初始排序，如果不设的话，将无法标记表头的排序状态。
71720编辑于 2022-04-25
来自专栏全栈程序员必看
java数组排序去重_JAVA数组去重排序
; i++) { arr[i] = (int) (Math.random() * 100) + 1; //随机赋值 System.out.print(arr[i] + ” “); } /* *冒泡排序法 } System.out.println(); for (int i = 0; i < arr.length; i++) { System.out.print(arr[i] + ” “); //排序后的数组 } /* * 数组去重 */ for(int i=0;i0&&arr[i-1]==arr[i]) break; System.out.print(arr[i] + ” “); }//去重后的数组 }
1.6K30编辑于 2022-09-07
来自专栏sunsky
使用SimHash进行海量文本去重
SimHash算法思想　　假设我们有海量的文本数据，我们需要根据文本内容将它们进行去重。对于文本去重而言，目前有很多NLP相关的算法可以在很高精度上来解决，但是我们现在处理的是大数据维度上的文本去重，这就对算法的效率有着很高的要求。而局部敏感hash算法可以将原始的文本内容映射为数字（hash签名），而且较为相近的文本内容对应的hash签名也比较相近。 SimHash算法是Google公司进行海量网页去重的高效算法，它通过将原始的文本映射为64位的二进制数字串，然后通过比较二进制数字串的差异进而来表示原始文本内容的差异。回到顶部 3. 那这样我们可以推断两个相似的文本，至少有16位的simhash是一样的。具体选择16位、8位、4位，大家根据自己的数据测试选择，虽然比较的位数越小越精准，但是空间会变大。
2.9K20发布于 2020-08-19
来自专栏深度学习|机器学习|歌声合成|语音合成
基于词向量的文本查重
基于词向量的文本查重 import gensim import numpy as np import jieba from gensim.models.doc2vec import Doc2Vec, LabeledSentence
1.3K10发布于 2021-01-14
来自专栏Spark学习技巧
必读|spark的重分区及排序
当时浪尖也在星球里讲了一下，整个关于分区排序的内容。今天，在这里给大家分享一下。昨天说了，mapPartitions 的使用技巧。假如，后面再跟mapPartitions算子的话，其算子就是针对已经按照key排序的分区，这就有点像mr的意思了。 repartitionAndSortWithinPartitions 也可以用于二次排序。下面举个简单的例子。 ) (4,also) (4,if) (4,including) mdhdeMacBook-Pro-3:output mdh$ head -n 10 part-00002 (47,) (17,to) (8,
1.5K20发布于 2019-05-09
来自专栏Spark学习技巧
必读|spark的重分区及排序
当时浪尖也在星球里讲了一下，整个关于分区排序的内容。今天，在这里给大家分享一下。更多大数据小技巧及调优，spark的源码文章，原理文章及源码视频请加入知识星球。假如，后面再跟mapPartitions算子的话，其算子就是针对已经按照key排序的分区，这就有点像mr的意思了。 repartitionAndSortWithinPartitions 也可以用于二次排序。下面举个简单的例子。 ) (4,also) (4,if) (4,including) mdhdeMacBook-Pro-3:output mdh$ head -n 10 part-00002 (47,) (17,to) (8, (2,Python) (2,locally) (2,This) (2,Hive) (2,SparkPi) mdhdeMacBook-Pro-3:output mdh$ 上面只是一个简单的使用，关于二次排序及高效结合
1.9K20发布于 2018-08-20
来自专栏全栈程序员必看
如何做文本分析_大数据文本行去重
以及局部敏感hash算法（[Algorithm] 局部敏感哈希算法(Locality Sensitive Hashing)），本文介绍的SimHash是一种局部敏感hash，它也是Google公司进行海量网页去重使用的主要算法 SimHash算法思想　　假设我们有海量的文本数据，我们需要根据文本内容将它们进行去重。对于文本去重而言，目前有很多NLP相关的算法可以在很高精度上来解决，但是我们现在处理的是大数据维度上的文本去重，这就对算法的效率有着很高的要求。 SimHash算法是Google公司进行海量网页去重的高效算法，它通过将原始的文本映射为64位的二进制数字串，然后通过比较二进制数字串的差异进而来表示原始文本内容的差异。回到顶部 3. 那这样我们可以推断两个相似的文本，至少有16位的simhash是一样的。具体选择16位、8位、4位，大家根据自己的数据测试选择，虽然比较的位数越小越精准，但是空间会变大。
76460编辑于 2022-11-15
一款可以对文本去重对比去重单去重查重的好用软件介绍文本综合处理软件教程
文本综合处理软件是一款专门用于重复类型处理文本的软件（1）可以对比去重，比如文本A和文本B,B中含有A的就去除（2）可以对单个文本去重 (3)可以查找文本A和文本B相同的文本（4）可以对文本A和文本 B合并去重 (5)可以去除文本中含有重复文本，包括重复文本本身，即有重复全部删除，更多好用软件请关注微信公众号未来自主研究中心
21000编辑于 2025-07-18
来自专栏深度学习之tensorflow实战篇
文本去重的技术方案讨论（一）
对于文本去重来说，我个人处理上会从数据量、文本特征、文本长度（短文本、长文本）几个方向考虑。常见的去重任务，如网页去重，帖子去重，评论去重等等。好的去重任务是不仅比对文本的相似性，还要比对语义上的相似性。下面我们来介绍下文本去重的方案。 simhash是google用来处理海量文本去重的算法。 google出品，你懂的。如果使用距离为3，短文本大量重复信息不会被过滤，如果使用距离为10，长文本的错误率也非常高，如何解决？代码实现 #coding:utf8 import math import jieba import jieba.analyse class SimHash(object): def __init
1.7K30发布于 2019-01-28
来自专栏第三方工具
Java8 - sum求和，将 List 集合转为 Map，key去重(groupingBy)，sorted排序
Java8 - sum求和，将 List 集合转为 Map，key去重(groupingBy)，sorted排序 package com.example.core.mydemo.java8; public setAmount(Integer amount) { this.amount = amount; } } package com.example.core.mydemo.java8; .mapToInt(GoodsPriceDTO::getAmount).sum(); System.out.println("amt=" + amt); //Java8 =" + map2); //如果出现相同的key，那么会抛出重复key的异常 //Duplicate key com.example.core.mydemo.java8. .sorted(Comparator.comparing(GoodsPriceDTO::getAmount)).collect(Collectors.toList()); //按价格排序
42410编辑于 2024-10-09
来自专栏云计算与大数据技术
MapReduce读取文本，实现降序排序
import org.apache.hadoop.util.Tool; import org.apache.hadoop.util.ToolRunner; /** * TODO MapReduce读取文本，实现降序排序 * @author com * @Date 2019年9月28日 Configured */ public class Top5 extends Configured implements 设置Mapper类和Reducer类 job.setMapperClass(MyMapper.class); job.setReducerClass(MyReduce.class); // 8、小蓝 8 小红 7 小黑 5 小白 4 小绿 3 小黄 2 小明 1
1.2K20发布于 2021-04-27
来自专栏天马行空布鲁斯
关于文本排序的那些事
这里讨论的文本排序不是一个排序算法，而是作为某个排序算法的底层依赖，常常在多语言环境下需要考虑，比如说中文的排序，日文的排序。本文讨论的文本排序就属于本地化范畴。一个系统要做到全球化，需要仔细考虑文本排序，因为文本排序可能会影响到系统的架构。我们创建数据库的时候没有指定，所以用的是default的collation，default的会参考操作系统默认的locale设定，这里是en_US.utf8。编程语言的支持对于文本排序，各个开发语言也都有很好的支持。文本搜索：字典树，Trie，按照字典排序。具体可以阅读：看动画轻松理解「Trie树」。
2.2K20发布于 2019-07-30
来自专栏搞前端的李蚊子
数组对象的去重然后排序
data: 1 },{ name: 'fff', data: 4 }, ]; const sort = arr => { // 去重 val.name] = val; newArr.push(val); }; }); // 最简单的使用sort去重 let sortArr = newArr.sort((a, b) => { return a.data - b.data; }); // 冒泡排序去重
1.3K130发布于 2018-03-14
来自专栏小鹏的专栏
基于召回和排序的文本搜索
key] for key in match_pre.keys()] ) ) print ("candidate_doc_dict:", candidate_doc_dict) # 再排序 edit_sim', 'jaccard_sim'] text_match_res = text_match_sort( query, candidate_doc_dict ) print ('排序的 score>>>>>', text_match_res) ''' # 排序 mf = ModelFactorySearch( match_models=['bm25', jaccard_sim'] ) mf.init(words_dict=candidate_doc_dict) pre = mf.predict(query) print ('排序的结果 0.9999999210000139, '4': 0.5460526286735667} candidate_doc_dict: {'2': '我在九寨沟', '3': '我在九寨沟,很喜欢', '4': '很喜欢'} 排序的
1.2K30发布于 2020-10-29
来自专栏互联网-小阿宇
linux对文本内容数字进行排序
首先，创建一个文件，里面每一行输入数字默认的排序方式是按照ASCII码进行升序 [root@localhost ~]# sort slow.txt > number.txt [root@localhost
1.9K20编辑于 2022-11-21
来自专栏全栈程序员必看
linux对文本内容数字进行排序
首先，创建一个文件，里面每一行输入数字默认的排序方式是按照ASCII码进行升序 [root@localhost ~]# sort slow.txt > number.txt [root@localhost
1.8K20编辑于 2022-06-29

第 2 页第 3 页第 4 页第 5 页第 6 页第 7 页第 8 页第 9 页第 10 页第 11 页

点击加载更多

Python文本去重

排序8: 计数排序

面试|海量文本去重~simhash

面试|海量文本去重～minhash

layui 异步数据排序重加载

java数组排序去重_JAVA数组去重排序

使用SimHash进行海量文本去重

基于词向量的文本查重

必读|spark的重分区及排序

必读|spark的重分区及排序

如何做文本分析_大数据文本行去重

一款可以对文本去重对比去重单去重查重的好用软件介绍文本综合处理软件教程

文本去重的技术方案讨论（一）

Java8 - sum求和，将 List 集合转为 Map，key去重(groupingBy)，sorted排序

MapReduce读取文本，实现降序排序

关于文本排序的那些事

数组对象的去重然后排序

基于召回和排序的文本搜索

linux对文本内容数字进行排序

linux对文本内容数字进行排序

社区

活动

圈层

关于

腾讯云开发者

热门产品

热门推荐

更多推荐