搜索 - 腾讯云开发者社区-腾讯云

文章/答案/技术大牛

发布

来自专栏AI机器学习与深度学习算法
机器学习入门 4-5 超参数
通过前面的小节，我们知道了kNN算法中k这个参数值，在sklearn中k这个值被封装成了k_neighbors参数。在前面我们随机的指定参数k的值，究竟k的值为多少的时候，模型才是最好的呢？这就涉及到了机器学习领域非常重要的问题~超参数问题。
76130发布于 2019-11-13
来自专栏机器学习与python集中营
【语料库】中文公开聊天语料库
该库搜集了包含 chatterbot 豆瓣多轮 PTT八卦语料青云语料电视剧对白语料贴吧论坛回帖语料微博语料小黄鸡语料共8个公开闲聊常用语料和短信，白鹭时代问答等语料。并对8个常见语料的数据进行了统一化规整和处理，达到直接可以粗略使用的目的。使用该项目，即可对所有的聊天语料进行一次性的处理和统一下载，不需要到处自己去搜集下载和分别处理各种不同的格式。给出的语料原链接是为了说明该语料的原始出处是在哪里环境 python3 处理过程将各个来源的语料按照其原格式进行提取，提取后进行繁体字转换，然后统一变成一轮一轮的对话。数据来源及说明语料名称语料数量语料来源说明语料特点语料样例是否已分词 chatterbot 560 开源项目按类型分类，质量较高 Q:你会开心的 A:幸福不是真正的可预测的情绪。否 xiaohuangji（小黄鸡语料） 45W 原人人网项目语料有一些不雅对话，少量噪音 Q:你谈过恋爱么 A:谈过，哎，别提了，伤心..。
9.9K50发布于 2019-05-29
来自专栏Hank’s Blog
4-5 R语言函数 split
#split根据因子或因子列表将向量或其他对象分组 #通常与lapply一起使用 #split(参数):split(向量/列表/数据框,因子/因子列表) > x <- c(rnorm(5),runif(5),rnorm(5,1)) > x [1] 0.61008707 0.81746169 -1.09859969 -1.78134612 -1.94262725 0.99760581 [7] 0.37793960 0.05258653 0.38525197 0.46051864 -0.
91840发布于 2020-09-16
来自专栏明天依旧可好的专栏
原始语料库
第一步：判断数据中是否存在重复数据创建python文件– 代码框架 ''' author: kzb time: 2018-12-10 ''' import pandas as pd import os,csv dataPath = os.path.join("音译原始数据.csv") def import_data(dataPath): ''' 导入文件中的数据 return:dataFrame ''' pass def find_En_Cn_excess(dataFrame
1K30发布于 2019-01-22
来自专栏机器学习AI算法工程
文本分类中语料库的获取——搜狗语料库
这次主要总结搜过语料库的获取，因为老师要求20万数据，而我自己只爬了2万多，所以用到了搜狗的语料库.
3.3K80发布于 2018-03-14
来自专栏大前端_Web
javascript高级程序设计(4-5)章笔记
版权声明：本文为吴孔云博客原创文章，转载请注明出处并带上链接，谢谢。 https://blog.csdn.net/wkyseo/article/details/51234909
73240发布于 2018-09-27
AI语料库智慧教学平台：用AI技术解锁语料教学新生态
传统语料教学中“资源零散难筛选、用法讲解不直观、练习反馈不及时”是长期痛点——教师要花大量时间整理语料、学生面对海量素材不知如何下手，很难实现“精准学、高效练”。而AI语料库智慧教学平台的出现，凭借前沿AI技术，把“智能语料导师”搬进课堂，让语料教学更精准、互动、可落地，彻底重构语言学习逻辑。核心技术之一是NLP语义检索与解析技术，这是平台的“语料导航大脑”。、语法规则，甚至标注语用禁忌。不同于普通语料库的关键词匹配，平台的AI模型经过多语种、多场景语料训练，能理解“同义替换”“场景延伸”需求，比如搜索“道歉表达”会自动关联日常、商务、学术等不同语境的语料。 AI语料库智慧教学平台用NLP、大数据分析等核心技术，让语料资源“活”了起来，破解了传统语料教学的效率低、匹配差、互动弱等问题。
45210编辑于 2025-10-29
来自专栏运维之路
【每日一思】2022年第4-5周
一直认为理想情况下的数据运营方法应该基于“贴源层数据-》指标（至少到带有主题的流水）-》洞察-》决策-》执行”的路线，这样才能减少返工的重复性工作量。
28120编辑于 2022-03-07
语料智能·知识无界：AI 多功能语料库检索平台重塑语言研究新范式
语言研究进入智能检索新时代在全球化和数字人文研究蓬勃发展的背景下，传统语料库检索系统面临检索维度单一、多模态语料支持不足、深层语义关联缺失等核心挑战。 AI 多功能语料库检索平台通过融合大语言模型、多模态理解和知识图谱技术，构建了智能化、多维化、深度化的语料检索与分析体系，实现了从"关键词匹配"到"语义理解"的研究范式革新。 -检索-分析"四层技术架构：多模态语料处理引擎实现文本、语音、图像的统一表征学习；深度语义检索模型支持基于意图理解的智能检索；知识图谱关联系统构建语料间的语义网络；可视化分析平台提供丰富的语料数据洞察能力数据安全与版权保护体系针对语料资源的版权敏感性，建立全方位保护机制：访问权限控制实现分级分权的语料访问；数字水印技术保护语料版权；操作日志审计追踪所有检索行为；数据脱敏处理在保护隐私的前提下开放研究。、不断进化的新一代语料库研究基础设施。
46710编辑于 2025-10-30
来自专栏iOS面试
iOS 面试策略之算法基础4-5节
前面介绍了数组、字典、字符串、链表、栈、队列的处理和应用方法。本节将会探讨平常相对很少用到、面试中却是老面孔的数据结构：二叉树。本节主要包括以下内容：
1.1K60发布于 2021-04-20
来自专栏NetCore 从壹开始
4-5 安装并迁移数据库：mysql
docker volume create volume_name命令新建一个数据卷
86920编辑于 2023-01-09
来自专栏JasonhavenDai
人民日报标注语料库（PFR）1.标记说明2.格式说明3.例子4.生语料库和熟语料库5.其他语料库汇总
PFR语料库是对人民日报1998年上半年的纯文本语料进行了词语切分和词性标注制作而成的，严格按照人民日报的日期、版序、文章顺序编排的。，文件中每一行代表一自然段或者一个标题，一篇文章有若干个自然段，因此在语料中一篇文章是由多行组成的。语料中除了词性标记以外，还有“短语标记”，这种情况一般出现在机构团体名称、成语等情况中。 /w 4.生语料库和熟语料库语料库中存放的是在语言的实际使用中真实出现过的语言材料，语料库是以电子计算机为载体承载语言知识的基础资源，真实语料需要经过加工、分析和处理之后才能成为可用的语料库生语料库是指收集之后未加工的预料库相对而言，熟语料库就是经过加工的 5.其他语料库汇总 http://blog.csdn.net/qq
6K80发布于 2018-04-11
来自专栏AI SPPECH
IO竞赛2025年题目解析：基础级难度（4-5）
2025年的IO竞赛基础级（难度系数4-5）题目开始涉及更多的数据结构和算法思想，对选手的编程能力和逻辑思维提出了更高的要求。难度进阶路径: 入门(1-3) → 基础(4-5) → 提高(6-8) → 竞赛(9-10) 难度系数考察重点核心知识点学习目标 4-5 数据结构、算法应用栈、队列、树、图的基础应用掌握基础数据结构的使用和简单算法的实现） ├── 第四章：基础级题目解题技巧总结 └── 第五章：从基础到提高的学习建议第一章：2025年IO竞赛基础级题目概述根据2025年NOI修订版大纲，基础级（CSP-J提高）的知识点难度系数为4-
34110编辑于 2025-11-13
来自专栏AI机器学习与深度学习算法
实战语言模型~语料词典的生成
sorted list iterable：是可迭代类型; cmp：用于比较的函数，比较什么由key决定; key：用列表元素的某个属性或函数进行作为关键字，有默认值，迭代集合中的一项; reverse：排序规则 fin.close() fout.close() ▲处理后的结果对valid以及test样本同理使train中的方法即可： ▲数据处理以及处理后的结构大致流程：构建词汇表需要在训练样本中统计语料中出现的单词
1.6K00发布于 2020-06-01
来自专栏AI科技评论
Facebook开源最大规模并行语料，45亿语料，覆盖576种语言对，或成为NMT评估标准
首先，从语料来源上讲。目前有几个公共的多语言并行语料库，主要来自一些国际会议（如European Parliament 、the United Nations）的语料，这些都是专业的人工翻译语料，使用语言较为正式，且仅限于政治主题为了使并行语料库量大、覆盖主题广泛，Facebook在CCMatrix这项工作中，选择使用了随机抓取web中的数据作为并行语料的来源，他们每个月随机发送url，从而获得包含各种语言的网页快照（TB级）。在当前版本的CCMatrix语料库中，作者限制为38种语言。（编者注：这是11月份数据，当时数据集规模为35亿并行语料，下同） CCMatrix：每种语言对的并行语料数量(单位：百万)，Margin阈值为1.06。
53110发布于 2020-02-21
来自专栏跟着官方文档学小程序开发
第二章小程序开发指南4-5
小程序经常需要向服务器传递数据或者从服务器拉取数据，这个时候可以使用wx.request这个API，在本章节会重点讨论wx.request的使用和注意事项。
67810编辑于 2025-08-25
来自专栏小小程序员——DATA
关联规则关联规则概述
关联规则概述关联规则 (Association Rules) 反映一个事物与其他事物之间的相互依存性和关联性。关联规则可以看作是一种IF-THEN关系。假设商品A被客户购买，那么在相同的交易ID下商品B也被客户挑选的机会就被发现了购物车分析是大型超市用来揭示商品之间关联的关键技术之一。
89810编辑于 2023-12-18
来自专栏AI研习社
Facebook开源最大规模并行语料，45亿语料，覆盖576种语言对，或成为NMT评估标准
首先，从语料来源上讲。目前有几个公共的多语言并行语料库，主要来自一些国际会议（如European Parliament 、the United Nations）的语料，这些都是专业的人工翻译语料，使用语言较为正式，且仅限于政治主题为了使并行语料库量大、覆盖主题广泛，Facebook在CCMatrix这项工作中，选择使用了随机抓取web中的数据作为并行语料的来源，他们每个月随机发送url，从而获得包含各种语言的网页快照（TB级）。在当前版本的CCMatrix语料库中，作者限制为38种语言。（编者注：这是11月份数据，当时数据集规模为35亿并行语料，下同） CCMatrix：每种语言对的并行语料数量(单位：百万)，Margin阈值为1.06。
1.4K20发布于 2020-02-21
大模型语料标注需要注意哪些？
一、语料类型 1.自采语料 2.商业语料 3.开源语料二、抽检要求 1.人工抽检要求具体做法:从全部语料中随机抽取不少于 4000 条语料:合格标准:合格率不应低于96%。以此来保证语料在人工抽检环节的质量水平。 2.技术抽检要求结合关键词、分类模型等技术进行抽检抽样数量:从全部语料中随机抽取不少于总量 10%的语料。合格标准:抽样合格率不应低于98%，保障技术抽检的语料质量。 3. 评估技术规范要求规范内容:评估采用的关键词库、分类模型应符合文件要求。确保在使用关键词、分类模型等技术进行语料抽检时，所使用的工具和模型是符合既定规范和标准的，从技术层面保障语料安全评估的科学性和准确性。
33910编辑于 2025-09-04
来自专栏前端说吧
flag - 4-5月份预整理总结的文章目录
关于echarts各种稀奇古怪让人想骂niang地需求的配置 js-sdk微信分享时，动态url的设置基于ajax渲染模板的二级/多级自定义联动下拉功能封装，一个基于promise的ajax异步请求函数封装，不用再写那么多遍的if result === 1啦！ css-移动端h5在iphonex的适配 vuex的使用步骤梳理，轻松掌握。附源码使用vue实现自定义多选与单选的答题功能 vue中使用axios，实现向请求头中传递cookie值 vue中，mode为history时，build打包后页面空白
74230发布于 2018-06-25

第 2 页第 3 页第 4 页第 5 页第 6 页第 7 页第 8 页第 9 页第 10 页第 11 页

点击加载更多

机器学习入门 4-5 超参数

【语料库】中文公开聊天语料库

4-5 R语言函数 split

原始语料库

文本分类中语料库的获取——搜狗语料库

javascript高级程序设计(4-5)章笔记

AI语料库智慧教学平台：用AI技术解锁语料教学新生态

【每日一思】2022年第4-5周

语料智能·知识无界：AI 多功能语料库检索平台重塑语言研究新范式

iOS 面试策略之算法基础4-5节

4-5 安装并迁移数据库：mysql

人民日报标注语料库（PFR）1.标记说明2.格式说明3.例子4.生语料库和熟语料库5.其他语料库汇总

IO竞赛2025年题目解析：基础级难度（4-5）

实战语言模型~语料词典的生成

Facebook开源最大规模并行语料，45亿语料，覆盖576种语言对，或成为NMT评估标准

第二章小程序开发指南4-5

关联规则关联规则概述

Facebook开源最大规模并行语料，45亿语料，覆盖576种语言对，或成为NMT评估标准

大模型语料标注需要注意哪些？

flag - 4-5月份预整理总结的文章目录

社区

活动

圈层

关于

腾讯云开发者

热门产品

热门推荐

更多推荐

机器学习入门 4-5 超参数

【语料库】中文公开聊天语料库

4-5 R语言函数 split

原始语料库

文本分类中语料库的获取——搜狗语料库

javascript高级程序设计(4-5)章笔记

AI语料库智慧教学平台：用AI技术解锁语料教学新生态

【每日一思】2022年第4-5周

语料智能·知识无界：AI 多功能语料库检索平台重塑语言研究新范式

iOS 面试策略之算法基础4-5节

4-5 安装并迁移数据库：mysql

人民日报标注语料库（PFR）1.标记说明2.格式说明3.例子4.生语料库和熟语料库5.其他语料库汇总

IO竞赛2025年题目解析：基础级难度（4-5）

实战语言模型~语料词典的生成

Facebook开源最大规模并行语料，45亿语料，覆盖576种语言对，或成为NMT评估标准

第二章 小程序开发指南4-5

关联规则 关联规则概述

Facebook开源最大规模并行语料，45亿语料，覆盖576种语言对，或成为NMT评估标准

大模型语料标注需要注意哪些？

flag - 4-5月份预整理总结的文章目录

社区

活动

圈层

关于

腾讯云开发者

热门产品

热门推荐

更多推荐

第二章小程序开发指南4-5

关联规则关联规则概述