上云无忧 > 文档中心 > 百度智能云飞桨EasyDL零门槛AI开发平台 - 文本分类(多标签)数据去重
飞桨EasyDL零门槛AI开发平台
百度智能云飞桨EasyDL零门槛AI开发平台 - 文本分类(多标签)数据去重

文档简介:
一个样本包括文本内容和标签。重复样本的定义,是指您上传的数据中,存在两个样本的文本内容完全一致。则被判定为两个样本是重复样本。例如: 未来的学和教正在改变,学生将会在家里学习,机器人将走上讲台。 education/science。
*此产品及展示信息均由百度智能云官方提供。免费试用 咨询热线:400-826-7010,为您提供专业的售前咨询,让您快速了解云产品,助您轻松上云! 微信咨询
  免费试用、价格特惠

重复样本的定义

一个样本包括文本内容和标签。重复样本的定义,是指您上传的数据中,存在两个样本的文本内容完全一致。则被判定为两个样本是重复样本。例如:

文本内容 标签
未来的学和教正在改变,学生将会在家里学习,机器人将走上讲台。 education/science
未来的学和教正在改变,学生将会在家里学习,机器人将走上讲台。 education/science
未来的学和教正在改变,学生将会在家里学习,机器人将走上讲台。 AI/robot

上表三个样本均为重复样本,后两个样本虽然标签不一,但文本内容一致,也为重复样本。

Tips: “如何利用好重复样本”,如果您在模型训练过程中,需要通过增加某个类别标签的预测权重,可以通过增加此标签的重复样本来达到此目标。

平台去重策略

平台提供了可去重的数据集,即对您上传的数据进行重复样本的去重。注意:当您确定了数据集为去重或非去重的属性后,便不可修改。

当您创建了一个去重的数据集时,在后续上传数据的过程中,平台可通过检验您当前上传的样本与已上传到此数据集下的样本是否相同,如果相同,则会使用新的样本替代旧的样本。此时分为几种情况,如下:

  1. 数据集中有未标注样本,上传重复的已标注样本,此时未标注样本将被覆盖
  2. 数据集中有已标注样本,上传重复的未标注样本,此时已标注样本将被覆盖
  3. 数据集中有已标注样本,上传不同标注的已标注样本,此时已有的标注样本将被覆盖
相似文档
官方微信
联系客服
400-826-7010
7x24小时客服热线
分享
  • QQ好友
  • QQ空间
  • 微信
  • 微博
返回顶部