搜索 - 腾讯云开发者社区-腾讯云

文章/答案/技术大牛

发布

来自专栏机器学习与python集中营
【语料库】中文公开聊天语料库
该库搜集了包含 chatterbot 豆瓣多轮 PTT八卦语料青云语料电视剧对白语料贴吧论坛回帖语料微博语料小黄鸡语料共8个公开闲聊常用语料和短信，白鹭时代问答等语料。并对8个常见语料的数据进行了统一化规整和处理，达到直接可以粗略使用的目的。使用该项目，即可对所有的聊天语料进行一次性的处理和统一下载，不需要到处自己去搜集下载和分别处理各种不同的格式。给出的语料原链接是为了说明该语料的原始出处是在哪里环境 python3 处理过程将各个来源的语料按照其原格式进行提取，提取后进行繁体字转换，然后统一变成一轮一轮的对话。数据来源及说明语料名称语料数量语料来源说明语料特点语料样例是否已分词 chatterbot 560 开源项目按类型分类，质量较高 Q:你会开心的 A:幸福不是真正的可预测的情绪。否 xiaohuangji（小黄鸡语料） 45W 原人人网项目语料有一些不雅对话，少量噪音 Q:你谈过恋爱么 A:谈过，哎，别提了，伤心..。
9.9K50发布于 2019-05-29
来自专栏以终为始
7-8 Left-pad （20 分)
7-8 Left-pad （20 分) 根据新浪微博上的消息，有一位开发者不满NPM（Node Package Manager）的做法，收回了自己的开源代码，其中包括一个叫left-pad的模块，就是这个模块把
55010编辑于 2023-03-09
来自专栏明天依旧可好的专栏
原始语料库
第一步：判断数据中是否存在重复数据创建python文件– 代码框架 ''' author: kzb time: 2018-12-10 ''' import pandas as pd import os,csv dataPath = os.path.join("音译原始数据.csv") def import_data(dataPath): ''' 导入文件中的数据 return:dataFrame ''' pass def find_En_Cn_excess(dataFrame
1K30发布于 2019-01-22
day 7-8 GEO数据挖掘
数据从哪里来：GEO NHANES(临床) TCGA ICGC CCLE SEER（临床
59610编辑于 2025-08-15
来自专栏刷题笔记
7-8 阅览室 (20 分)
本文链接：https://blog.csdn.net/shiliang97/article/details/99688636 7-8 阅览室 (20 分) 天梯图书阅览室请你编写一个简单的图书借阅统计程序
70510发布于 2019-11-08
来自专栏机器学习AI算法工程
文本分类中语料库的获取——搜狗语料库
这次主要总结搜过语料库的获取，因为老师要求20万数据，而我自己只爬了2万多，所以用到了搜狗的语料库.
3.3K80发布于 2018-03-14
AI语料库智慧教学平台：用AI技术解锁语料教学新生态
传统语料教学中“资源零散难筛选、用法讲解不直观、练习反馈不及时”是长期痛点——教师要花大量时间整理语料、学生面对海量素材不知如何下手，很难实现“精准学、高效练”。而AI语料库智慧教学平台的出现，凭借前沿AI技术，把“智能语料导师”搬进课堂，让语料教学更精准、互动、可落地，彻底重构语言学习逻辑。核心技术之一是NLP语义检索与解析技术，这是平台的“语料导航大脑”。、语法规则，甚至标注语用禁忌。不同于普通语料库的关键词匹配，平台的AI模型经过多语种、多场景语料训练，能理解“同义替换”“场景延伸”需求，比如搜索“道歉表达”会自动关联日常、商务、学术等不同语境的语料。 AI语料库智慧教学平台用NLP、大数据分析等核心技术，让语料资源“活”了起来，破解了传统语料教学的效率低、匹配差、互动弱等问题。
45210编辑于 2025-10-29
来自专栏萌海无涯
centos 7-8重置root密码
引导至GRUB菜单并进入编辑模式。使用箭头导航至通常从中引导 Centos 7 Linux系统的菜单项。按下e以开始编辑所选菜单项。
1.9K10发布于 2021-02-24
来自专栏刷题笔记
7-8 堆栈模拟队列 (25 分)
本文链接：https://blog.csdn.net/shiliang97/article/details/97869472 7-8 堆栈模拟队列 (25 分) 设已知有两个堆栈S1和S2，请用这两个堆栈模拟出一个队列
1.2K20发布于 2019-11-08
语料智能·知识无界：AI 多功能语料库检索平台重塑语言研究新范式
语言研究进入智能检索新时代在全球化和数字人文研究蓬勃发展的背景下，传统语料库检索系统面临检索维度单一、多模态语料支持不足、深层语义关联缺失等核心挑战。 AI 多功能语料库检索平台通过融合大语言模型、多模态理解和知识图谱技术，构建了智能化、多维化、深度化的语料检索与分析体系，实现了从"关键词匹配"到"语义理解"的研究范式革新。 -检索-分析"四层技术架构：多模态语料处理引擎实现文本、语音、图像的统一表征学习；深度语义检索模型支持基于意图理解的智能检索；知识图谱关联系统构建语料间的语义网络；可视化分析平台提供丰富的语料数据洞察能力数据安全与版权保护体系针对语料资源的版权敏感性，建立全方位保护机制：访问权限控制实现分级分权的语料访问；数字水印技术保护语料版权；操作日志审计追踪所有检索行为；数据脱敏处理在保护隐私的前提下开放研究。、不断进化的新一代语料库研究基础设施。
46710编辑于 2025-10-30
来自专栏ReganYue's Blog
【PTA】7-8 到底有多二 (15分)
一个整数“犯二的程度”定义为该数字中包含2的个数与其位数的比值。如果这个数是负数，则程度增加0.5倍；如果还是个偶数，则再增加1倍。例如数字-13142223336是个11位数，其中有3个2，并且是负数，也是偶数，则它的犯二程度计算为：3/11×1.5×2×100%，约为81.82%。本题就请你计算一个给定整数到底有多二。
78730发布于 2021-09-16
来自专栏JasonhavenDai
人民日报标注语料库（PFR）1.标记说明2.格式说明3.例子4.生语料库和熟语料库5.其他语料库汇总
PFR语料库是对人民日报1998年上半年的纯文本语料进行了词语切分和词性标注制作而成的，严格按照人民日报的日期、版序、文章顺序编排的。，文件中每一行代表一自然段或者一个标题，一篇文章有若干个自然段，因此在语料中一篇文章是由多行组成的。语料中除了词性标记以外，还有“短语标记”，这种情况一般出现在机构团体名称、成语等情况中。 /w 4.生语料库和熟语料库语料库中存放的是在语言的实际使用中真实出现过的语言材料，语料库是以电子计算机为载体承载语言知识的基础资源，真实语料需要经过加工、分析和处理之后才能成为可用的语料库生语料库是指收集之后未加工的预料库相对而言，熟语料库就是经过加工的 5.其他语料库汇总 http://blog.csdn.net/qq
6K80发布于 2018-04-11
来自专栏刷题笔记
【未完成】7-8 最长有效括号串 (20 分)13分
本文链接：https://blog.csdn.net/shiliang97/article/details/101473397 7-8 最长有效括号串 (20 分) 给定一个只含左右小括号的括号串序列
50130发布于 2019-11-08
来自专栏刷题笔记
7-8 汉诺塔的非递归实现
点这里 7-8 汉诺塔的非递归实现借助堆栈以非递归（循环）方式求解汉诺塔的问题（n, a, b, c），即将N个盘子从起始柱（标记为“a”）通过借助柱（标记为“b”）移动到目标柱（标记为“c”），并保证每个移动符合汉诺塔问题的要求
1.1K10发布于 2019-11-08
来自专栏ReganYue's Blog
【PTA】7-8 显示菱形 (10point(s))
请编写函数，输入菱形的行数和组成菱形的字符，输出对应的菱形图像。输入样例 5 $ 输出样例 $ $$$ $$$$$ $$$ $ 要求：若行数小于等于 0，则输出 None；若行数是偶数，则输出Error。 #include int main() { int n; char c; scanf("%d %c",&n,&c); if(n<=0) printf("None"); else if(n%2==0) printf("Error"); else { int m=n/2+1;
39220发布于 2021-09-16
来自专栏刷题笔记
【未完成】7-8 社交集群 (30 分)
本文链接：https://blog.csdn.net/shiliang97/article/details/102727534 7-8 社交集群 (30 分) 当你在社交网络平台注册时，一般总是被要求填写你的个人兴趣爱好
53500发布于 2019-11-07
来自专栏AI机器学习与深度学习算法
实战语言模型~语料词典的生成
sorted list iterable：是可迭代类型; cmp：用于比较的函数，比较什么由key决定; key：用列表元素的某个属性或函数进行作为关键字，有默认值，迭代集合中的一项; reverse：排序规则 fin.close() fout.close() ▲处理后的结果对valid以及test样本同理使train中的方法即可： ▲数据处理以及处理后的结构大致流程：构建词汇表需要在训练样本中统计语料中出现的单词
1.6K00发布于 2020-06-01
来自专栏AI科技评论
Facebook开源最大规模并行语料，45亿语料，覆盖576种语言对，或成为NMT评估标准
首先，从语料来源上讲。目前有几个公共的多语言并行语料库，主要来自一些国际会议（如European Parliament 、the United Nations）的语料，这些都是专业的人工翻译语料，使用语言较为正式，且仅限于政治主题为了使并行语料库量大、覆盖主题广泛，Facebook在CCMatrix这项工作中，选择使用了随机抓取web中的数据作为并行语料的来源，他们每个月随机发送url，从而获得包含各种语言的网页快照（TB级）。在当前版本的CCMatrix语料库中，作者限制为38种语言。（编者注：这是11月份数据，当时数据集规模为35亿并行语料，下同） CCMatrix：每种语言对的并行语料数量(单位：百万)，Margin阈值为1.06。
53110发布于 2020-02-21
来自专栏刷题笔记
【2020HBU天梯赛训练】7-8 矩阵A乘以B
7-8 矩阵A乘以B 给定两个矩阵A和B，要求你计算它们的乘积矩阵AB。需要注意的是，只有规模匹配的矩阵才可以相乘。
83920发布于 2020-06-23
来自专栏小小程序员——DATA
关联规则关联规则概述
关联规则概述关联规则 (Association Rules) 反映一个事物与其他事物之间的相互依存性和关联性。关联规则可以看作是一种IF-THEN关系。假设商品A被客户购买，那么在相同的交易ID下商品B也被客户挑选的机会就被发现了购物车分析是大型超市用来揭示商品之间关联的关键技术之一。
89810编辑于 2023-12-18

第 2 页第 3 页第 4 页第 5 页第 6 页第 7 页第 8 页第 9 页第 10 页第 11 页

点击加载更多

【语料库】中文公开聊天语料库

7-8 Left-pad （20 分)

原始语料库

day 7-8 GEO数据挖掘

7-8 阅览室 (20 分)

文本分类中语料库的获取——搜狗语料库

AI语料库智慧教学平台：用AI技术解锁语料教学新生态

centos 7-8重置root密码

7-8 堆栈模拟队列 (25 分)

语料智能·知识无界：AI 多功能语料库检索平台重塑语言研究新范式

【PTA】7-8 到底有多二 (15分)

人民日报标注语料库（PFR）1.标记说明2.格式说明3.例子4.生语料库和熟语料库5.其他语料库汇总

【未完成】7-8 最长有效括号串 (20 分)13分

7-8 汉诺塔的非递归实现

【PTA】7-8 显示菱形 (10point(s))

【未完成】7-8 社交集群 (30 分)

实战语言模型~语料词典的生成

Facebook开源最大规模并行语料，45亿语料，覆盖576种语言对，或成为NMT评估标准

【2020HBU天梯赛训练】7-8 矩阵A乘以B

关联规则关联规则概述

社区

活动

圈层

关于

腾讯云开发者

热门产品

热门推荐

更多推荐

【语料库】中文公开聊天语料库

7-8 Left-pad （20 分)

原始语料库

day 7-8 GEO数据挖掘

7-8 阅览室 (20 分)

文本分类中语料库的获取——搜狗语料库

AI语料库智慧教学平台：用AI技术解锁语料教学新生态

centos 7-8重置root密码

7-8 堆栈模拟队列 (25 分)

语料智能·知识无界：AI 多功能语料库检索平台重塑语言研究新范式

【PTA】7-8 到底有多二 (15分)

人民日报标注语料库（PFR）1.标记说明2.格式说明3.例子4.生语料库和熟语料库5.其他语料库汇总

【未完成】7-8 最长有效括号串 (20 分)13分

7-8 汉诺塔的非递归实现

【PTA】7-8 显示菱形 (10point(s))

【未完成】7-8 社交集群 (30 分)

实战语言模型~语料词典的生成

Facebook开源最大规模并行语料，45亿语料，覆盖576种语言对，或成为NMT评估标准

【2020HBU天梯赛训练】7-8 矩阵A乘以B

关联规则 关联规则概述

社区

活动

圈层

关于

腾讯云开发者

热门产品

热门推荐

更多推荐

关联规则关联规则概述