基于CNN的在线论坛抑郁与自残风险评估——EMNLP 2017最佳长论文阅读笔记
基于CNN的在线论坛抑郁与自残风险评估——EMNLP 2017最佳长论文阅读笔记
论文信息
- 论文标题:Depression and Self-Harm Risk Assessment in Online Forums
- 会议:EMNLP 2017(最佳长论文)
- 论文链接:arXiv:1709.01848
作者团队
| 作者 | 背景 |
|---|---|
| Andrew Yates(第一作者) | 乔治城大学计算机博士,目前在德国马克思普朗克信息学院从事博士后研究,博士期间已发表多篇深度学习+信息检索/NLP相关论文 |
| Arman Cohan(第二作者) | 伊朗籍,乔治城大学计算机系博士生,在信息检索和NLP料向发表多篇论文,曾在Medstar Health和Adobe研究院实习 |
| Nazli Goharian(第三作者/导师) | 乔治城大学计算机系教授,20年产学研经验,信息检索与文本分析领域发表20余篇论文 |
研究背景与问题
现代社会精神疾病问题日益突出,大量患者在Reddit、Twitter等在线社区中寻求帮助和交流。研究这些用户的在线行为对设计更契合其需求的辅助系统、帮助社会研究人员分析其精神状态具有重要意义。
论文提出的核心问题是:如何利用NLP技术自动检测在线论坛用户是否患有抑郁症,以及评估其自残风险等级?
主要贡献
构建了大规模标注数据集:从Reddit 2006-2016十年数据中挖掘,通过语料库句式匹配,如"我已经被诊断得了抑郁症")高精度筛选帖子,经人工标注得到9210个精神疾病用户(正例),并采用严格匹配策略找到107274个负例用户。正负例用户在其他特征上尽量相似,确保对比的有效性。每个用户平均发布969个帖子,平均长度超过140字。
评估自残风险的数据集:利用ReachOut在线社区数据,包含65024个论坛帖子,其中1227个涉及自残,并按紧急程度分为五个等级。
提出了通用的CNN文本分析框架,可同时适用于抑郁症检测和自残风险评估两个任务。
核心方法:CNN文本分析框架
整体流程分为三步:
第一步:帖子级特征提取(CNN)
对每个帖子的单词序列:
- 卷积层(Convolutional Layer):对一定窗口范围内的单词提取局部特征
- 最大池化层(Max Pooling Layer):对卷积提取的特征进行集中降维
- 输出:每个帖子转换为一个特征向量(Feature Vector)
本质上就是将图像处理中的标准卷积操作迁移到文本上。
第二步:用户级表征构建
根据任务不同,采用不同的聚合策略:
| 任务 | 聚合方式 |
|---|---|
| 抑郁症检测 | 将该用户所有帖子的特征向量直接取平均 |
| 自残风险评估 | 将所有帖子平铺拼接,并将当前帖子之前的帖子作为负例一并拼接,不做平均处理 |
第三步:分类器构建
使用多层全连接层(Fully Connected Layer)将用户表征映射到目标标签。
实验结果
抑郁症检测任务
| 方法 | Precision | Recall | F1 |
|---|---|---|---|
| 本文方法(CNN) | — | 0.45 | 0.51 |
| SVM + 文本特征 | 0.72 | 0.29 | — |
本文方法在召回率上明显优于SVM基线,F1值综合更高。
自残风险评估任务
| 指标 | 数值 |
|---|---|
| 准确率 | 0.89 |
| F1值 | 0.61 |
在所有对比方法中均取得最优效果。
核心要点总结
- 这是NLP技术应用于社会问题的一次成功实践——用深度学习自动识别精神疾病用户,具有现实意义。
- 论文构建的大规模、高质量标注数据集本身就是一个重要贡献。
- 方法思路上清晰通用:CNN提取帖子特征 → 按任务聚合为用户表征 → 全连接层分类,这一模式可迁移到其他文本挖掘场景。
- 卷积操作在文本上的有效性值得关注:图像中卷积捕捉局部空间模式,文本中则捕捉局部语义组合(如短语、搭配),本质上都是在提取局部特征。
阅读笔记 · 整理自极客时间《AI技术内参》