腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
2
回答
当在Scikit的光谱聚类中使用
预先
计算的亲和力矩阵时,KNN?
python
、
machine-learning
、
scikit-learn
、
cluster-analysis
、
unsupervised-learning
我有一个
相似
度
矩阵,我计算了大量对象之间的
相似
度
,每个对象可以与任何其他对象具有非零的
相似
度
。我为另一个任务生成了这个矩阵,现在想对其进行聚类以进行新的分析。看起来方法可能是一个很好的选择,因为我可以传入一个
预先
计算的亲和
度
矩阵。我还知道,在构建亲和
度
矩阵时,谱聚类通常会使用一些最近的邻居,而我的
相似
性矩阵没有同样的约束。如果不是,我想我将不得不对我的
预先
计算的亲和
度
矩阵进行更改。
浏览 1
提问于2016-10-20
得票数 0
1
回答
聚类算法
machine-learning
、
data-mining
、
clustering
我有稀疏向量,并且发现余弦
相似
度
是度量
相似
度
的有效方法。现在我想根据
相似
性对这些向量进行聚类。因此,有人能建议/推荐使用余弦
相似
性的聚类算法吗? P.S.:我没有
预先
定义好的簇数,而是希望聚类算法自己来决定它。
浏览 0
提问于2017-07-03
得票数 0
回答已采纳
1
回答
用预训练的词向量生成长文档的嵌入
python
、
nlp
、
huggingface-transformers
、
word-embedding
、
sentence-similarity
我有一套从维基百科语料库中
预先
训练过的单词嵌入。我也有300个维度嵌入维基百科文章页面。我希望通过运行一个简单的余弦
相似
算法来构建一个
相似
引擎,用于针对这些
预先
训练过的嵌入的任何新查询(长文档)。为此,我希望使用
预先
训练过的单词嵌入将任何新的输入文档表示为300 d向量,然后对语料库运行余弦
相似
度
。如何才能做到这一点?
浏览 12
提问于2022-11-15
得票数 0
2
回答
列表中两个单词之间的余弦
相似
度
python
、
word2vec
我正在定义一个函数,它接受一个单词列表,并返回列表中彼此之间具有非零余弦
相似
度
(以及
相似
度
值)的单词的相关信息。 有人能帮我解决这个问题吗。我在想,如果我能得到一个
预先
计算的word2vec矢量文件,那将是非常有帮助的,但互联网上没有。
浏览 2
提问于2015-04-07
得票数 6
回答已采纳
1
回答
一种面向FastText的聚类方法
cluster-analysis
、
fasttext
我正在使用
预先
训练好的fastText ()向量对短聊天消息执行聚类。这意味着结果向量将是组成消息的令牌的平均值。在这种情况下,如何选择正确的聚类方法?
浏览 0
提问于2018-08-22
得票数 2
1
回答
如何根据常用词对文本进行分类
python
、
pandas
、
nlp
、
nltk
这个问题是关于基于常用词的文本分类,我不知道我是否正确地处理了这个问题我有一个excel,在"Description“列中有文本,在" ID”列中有一个唯一的ID,我想迭代描述,并根据文本中常见单词的百分比或频率比较它们。我想对描述进行分类,并给它们另一个ID。请参见下面的示例…… import pandas as pd df = pd.DataFrame({'ID': ['12 ', '54'
浏览 21
提问于2019-08-22
得票数 0
1
回答
在mahout中使用GenericItemSimilarity时如何提高内存使用率(品味)
mahout
众所周知,在genericItemSimilarity中,item1和item2之间的
相似
度
是
预先
计算的。initSimilarityMaps(new DataModelSimilaritiesIterator(otherSimilarity, itemIDs));只需使用dataModel及时生成
相似
性地图即可是否有必要将
相似
度
图存储到Db/file? 我发现mahout0.7有一个名为FileItemItemSimilarityIterator的类可以帮助你从文件
浏览 3
提问于2012-08-22
得票数 0
回答已采纳
1
回答
域特定词
相似
度
nlp
、
word2vec
、
similarity
、
cosine-similarity
有谁知道如何使用一个精确的工具或方法来计算单词嵌入或发现特定领域的单词之间的
相似
性呢?我正在从事一个NLP项目,该项目涉及计算技术术语之间的余弦
相似
度
,比如“地址”和“套接字”,但是像word2vec这样经过
预先
训练的模型并没有给出有用的嵌入或精确的余弦
相似
性,因为它们并不是特定于技术术语的由于“地址”和“套接字”的一般非技术性含义并不
相似
,这些经过
预先
训练的模型并没有为我的项目提供足够高的
相似
分数。会感谢人们能提供的任何建议。谢谢!
浏览 6
提问于2022-02-20
得票数 0
回答已采纳
1
回答
lucene是如何构建VSM的?
lucene
、
indexing
、
data-mining
、
similarity
、
tf-idf
我理解了VSM,TFIDF和余弦
相似
的概念,但是,在阅读lucene网站之后,我仍然对lucene如何构建VSM和计算每个查询的
相似
度
感到困惑。另外,使用
预先
构建的VSM,查找最
相似
的文档(基本上是计算两个文档或查询与文档之间的
相似
性)通常很耗时(假设有数百万个文档,因为必须计算每个人的
相似
度
),但是lucene似乎真的很快。因此,请在这里帮助我理解两点: 1. lucene如何如此快速地构建VSM,可以用来计算
相似
度</em
浏览 7
提问于2014-02-14
得票数 1
回答已采纳
1
回答
构建产品推荐系统、协同过滤和图形库
neo4j
、
graph-databases
、
recommendation-engine
当我读到使用协作过滤构建推荐系统时,他们通常不会谈论像neo4j这样的图形数据库。图形数据库是否足以实现最好的推荐系统? 他们似乎可以比这里提到的方法更容易地实现实时建议:https://eugeneyan.com/writing/real-time-recommendations/ 我应该意识到的任何缺点,或者像neo4j这样的东西完全适合这个任务,而不需要其他任何东西?
浏览 16
提问于2021-07-09
得票数 0
回答已采纳
2
回答
使用Mahout实现基于离线项的推荐
mahout
、
recommendation-engine
、
mahout-recommender
我正在寻找一种通过离线计算项目
相似
度
来提供推荐的方法,这样recommender.recommend()方法将在100毫秒内提供结果。new GenericBooleanPrefItemBasedRecommender(dataModel,_itemSimilarity));PS
浏览 0
提问于2013-06-13
得票数 1
回答已采纳
1
回答
为什么我的余弦
相似
度
总是为正?(快速文本)
numpy
、
trigonometry
、
similarity
、
fasttext
我正在尝试评估代表单词的两个向量的余弦
相似
度
。我使用的是快速文本中
预先
训练好的单词向量。现在,我想知道为什么我的余弦
相似
度
总是正数,不管我用的是什么词。有什么建议吗? 这是我的代码的一部分。
浏览 15
提问于2020-03-26
得票数 0
1
回答
如何仅根据列表的标题向用户建议标记?
machine-learning
、
nlp
我们有大约30个
预先
确定的标签- Gaming, Movies, TV shows, Documentaries, Books, Music, Art, History, People, Adventure
浏览 0
提问于2017-11-28
得票数 0
回答已采纳
1
回答
基于内容的规模推荐
apache-spark
、
scikit-learn
、
mahout
、
recommendation-engine
、
mahout-recommender
根据产品的属性(如国家、类型、价格)计算所有n种产品的项目
相似
性。当用户需要推荐-循环之前购买的产品p为用户u,并获取类似的产品(
相似
是在前面的步骤) 如果我是对的,我们称之为基于内容的推荐,而不是协作过滤,因为它不涉及项目的共现或用户对项目的首选项。
浏览 7
提问于2015-04-23
得票数 4
回答已采纳
1
回答
SBERT的可理解性:我们能更好地理解最终结果吗?
nlp
、
transformer-model
、
sentence-transformers
我很熟悉SBERT和它的
预先
训练的模型,他们是惊人的!但同时,我想了解结果是如何计算的,我在他们的中找不到更具体的东西。例如,我有一个文档,我希望找到与它类似的其他文档。我使用了两个文档,每个文档包含200-250个单词(我将model.max_seq_length改为350个,这样模型就可以处理更大的文本),最后我们可以看到余弦
相似
度
为0.79。是否有一种方法可以提取使模型返回如此高的
相似
度
值的主要短语/关键字? 提前感谢!
浏览 11
提问于2022-02-16
得票数 2
2
回答
大型数据集余弦
相似
度
的确定
python
、
machine-learning
、
deep-learning
、
recommendation-engine
、
cosine-similarity
我使用以下代码使用一些
预先
计算的嵌入来计算余弦
相似
度
。cosine_similarity = 1-pairwise_distances(embeddings, metric='cosine')除了获取数据集中的每个数据点之间的
相似
性度量之外,还有其他选择吗?
浏览 5
提问于2022-03-29
得票数 -1
3
回答
以最快的方式实现1vsall在嵌入上的查找
machine-learning
、
bert
、
embeddings
、
cosine-distance
、
similar-documents
我希望将一个新的看不见的文本与所有1000000个
预先
计算的嵌入进行比较,并执行余弦
相似
度
来检索语料库中最
相似
的文档。我感谢你的指点和反馈!
浏览 0
提问于2020-03-15
得票数 1
回答已采纳
2
回答
相似
矩阵->特征向量算法?
algorithm
、
vector
、
machine-learning
、
data-mining
、
similarity
如果我们有一组M词,并且
预先
知道每一对单词的意思的
相似
性(有一个M
相似
矩阵),那么我们可以使用哪一种算法为每个单词生成一个k维位向量,这样就可以通过比较每一对单词的向量来比较它们的意思(例如,得到向量的绝对差如果从矩阵上看,word A与word B
相似
,B与C
相似
,但检测到的A、C
相似
度
较低,则计算结果向量差也应产生较高的A、C
相似
度
。因此,我们将填补之前在矩阵中的空白-以某种方式消除与该算法的
相似
之处。但除了这种
浏览 12
提问于2011-10-12
得票数 6
回答已采纳
1
回答
来自网络研讨会的培训word2vec字幕
nlp
、
word2vec
、
doc2vec
我偶然发现了word2vec,它可以找到余弦
相似
的
相似
单词。
浏览 2
提问于2019-05-10
得票数 0
1
回答
如何将一组单词分类为给定的标签之一
classification
、
nlp
我有三个标签:娱乐,平静和精力充沛。我得到了这样的词集: Set1 ={云天人,植物闪光摄影,快乐短裤,草休闲娱乐} Set2 ={植物绿色,自然景观,自然环境,树枝,树木,人在自然界,树形树木,落叶}我想把这些词分类成一个标签。你们觉得怎么样?Set1应该贴上精力充沛的标签,Set2应该贴上平静的标签。
浏览 0
提问于2021-05-22
得票数 2
回答已采纳
点击加载更多
相关
资讯
论文查重相似度28%能通达吗 发表论文的相似度是多少?
文本相似度计算综述
移动端图像相似度算法选型
OpenAI抄袭Deepseek,相似度超过92%?
计算图像相似度——《Python也可以》
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
实时音视频
活动推荐
运营活动
广告
关闭
领券