热门标签 | HotTags
当前位置:  开发笔记 > 后端 > 正文

【分享】细粒度的评论标注语料

数据简介用户评论分析可以帮助商家倾听用户声音,分析用户满意度,从而及时进行营销策略制定、危机公关等商业决策。但现在的评论语料主要对评论做褒义贬义的粗粒度标注,而对评论内容本身无法理解。我们提供了一个

数据简介


用户评论分析可以帮助商家倾听用户声音,分析用户满意度,从而及时进行营销策略制定、危机公关等商业决策。但现在的评论语料主要对评论做褒义/贬义的粗粒度标注,而对评论内容本身无法理解。


我们提供了一个细粒度的评论标注语料,详细标注了用户评论中的评价对象和评价特征。本语料可以用于情感计算、评论抽取、口碑分析等用途。


数据格式


本语料以xml的形式提供,数据量有160多M大小。共收集了36万篇来自各大汽车论坛的帖子,并人工区分出2.7万篇包含用户对汽车评论的帖子,然后做了细粒度的标注,得到5.7万条标注结果。标注结果包括评价对象以及该对象的评价特征。


评价对象包括:

1)厂商:一汽、大众、日产、本田等

2)品牌:奔驰、宝马、奥迪、凯美瑞等

3)型号:ES240、1.8T手自一体等

4)属性:整体、外观、油耗、动力、性价比、售后、内饰等


评价特征包括:

1)评价内容:用户对厂商、品牌、型号或者属性的主观性评价描述,例如“省油”、“好看”

2)描述值:用户对属性的客观性描述,例如”油耗是12”

3)倾向性:用户评价是褒义、贬义还是中性


标注时还考虑了很多细节:

1)如果评论里包含多个评价对象,则分别进行标注。例如对“某车外观挺好看,就是空间不够宽敞”,分别对某车外观和某车空间进行了标注

2)对用户没有明确说出来的隐含对象,也做了标注。例如对“某车很漂亮”,标注出属性“外观”

3)对比较句也做了标注。例如“某车的内饰不如某车丰富”

4)对用户评价适用的条件也做了标注。例如“某车在跑高速的时候很省油”,将“跑高速”也做了标注

5)记录了程度副词。例如“很漂亮”、“太贵”


数据样例


标注例子1:蒙迪欧致胜2.3豪华版在市区开的时候,油耗到14了,太高了!


品牌 型号 属性 描述值 评价内容 倾向性 条件 原帖是否没明确说出该属性
蒙迪欧 致胜2.3豪华版 油耗 14 太高 贬义 市区开 0(明确说出了)


标注例子2:跟迈腾和奥迪相比,速腾太省油了


品牌 属性 对比品牌 评价内容 倾向性 原帖是否没明确说出该属性
速腾 油耗 奥迪 省油 褒义 1(没明确说出)
速腾 油耗 迈腾 省油 褒义 1(没明确说出)


数据下载:http://www.datatang.com/data/15722

数据堂-数据共享服务平台



推荐阅读
  • 基于KVM的SRIOV直通配置及性能测试
    SRIOV介绍、VF直通配置,以及包转发率性能测试小慢哥的原创文章,欢迎转载目录?1.SRIOV介绍?2.环境说明?3.开启SRIOV?4.生成VF?5.VF ... [详细]
  • RecyclerView初步学习(一)
    RecyclerView初步学习(一)ReCyclerView提供了一种插件式的编程模式,除了提供ViewHolder缓存模式,还可以自定义动画,分割符,布局样式,相比于传统的ListVi ... [详细]
  • 本文介绍如何使用布局文件在Android应用中排列多行TextView和Button,使其占据屏幕的特定比例,并提供示例代码以帮助理解和实现。 ... [详细]
  • 本文探讨了在Windows Server 2008环境下配置Tomcat使用80端口时遇到的问题,包括端口被占用、多项目访问失败等,并提供详细的解决方法和配置建议。 ... [详细]
  • 本文详细介绍超文本标记语言(HTML)的基本概念与语法结构。HTML是构建网页的核心语言,通过标记标签描述页面内容,帮助开发者创建结构化、语义化的Web页面。 ... [详细]
  • 本文探讨了如何使用自增和自减运算符遍历二维数组中的元素。通过实例详细解释了指针与二维数组结合使用的正确方法,并解答了常见的错误用法。 ... [详细]
  • Struts与Spring框架的集成指南
    本文详细介绍了如何将Struts和Spring两个流行的Java Web开发框架进行整合,涵盖从环境配置到代码实现的具体步骤。 ... [详细]
  • 本文介绍了如何通过设置背景形状来轻松地为 Android 的 TextView 添加圆形边框。我们将详细讲解 XML 代码的配置,包括圆角、描边和填充等属性。 ... [详细]
  • 该平台旨在为大型企业提供一个高效、灵活且可扩展的分布式微服务架构解决方案。它采用模块化、微服务化和热部署的设计理念,结合当前最先进且无商业限制的主流开源技术,如Spring Cloud、Spring Boot2、MyBatis、OAuth2和Element UI,实现前后端分离的系统管理平台。 ... [详细]
  • 精选30本C# ASP.NET SQL中文PDF电子书合集
    欢迎订阅我们的技术博客,获取更多关于C#、ASP.NET和SQL的最新资讯和资源。 ... [详细]
  • 在维护公司项目时,发现按下手机的某个物理按键后会激活相应的服务,并在屏幕上模拟点击特定坐标点。本文详细介绍了如何使用ADB Shell Input命令来模拟各种输入事件,包括滑动、按键和点击等。 ... [详细]
  • 使用Python在SAE上开发新浪微博应用的初步探索
    最近重新审视了新浪云平台(SAE)提供的服务,发现其已支持Python开发。本文将详细介绍如何利用Django框架构建一个简单的新浪微博应用,并分享开发过程中的关键步骤。 ... [详细]
  • 本文详细介绍了美国最具影响力的十大财团,包括洛克菲勒、摩根、花旗银行等。这些财团在历史发展过程中逐渐形成,并对美国的经济、政治和社会产生深远影响。 ... [详细]
  • 本文总结了涡喷发动机动平衡的几种有效方法,探讨了不同传感器和软件工具的应用,旨在帮助爱好者和工程师更好地理解和实现动平衡调整,确保发动机高效稳定运行。 ... [详细]
  • 本文详细介绍了如何在CentOS 7操作系统上安装和配置Grafana,包括必要的依赖项安装、插件管理以及服务启动等步骤。 ... [详细]
author-avatar
业余爱好者
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有