【DeepLearning学习笔记】DynamicAutoEncodersforSemanticIndexing_Mirowski_NIPS2010

作者：醉苏芳华 | 来源：互联网 | 2023-12-13 23:30

发表于NIPS2010workshopondeeplearning的一篇文章，看得半懂。主要内容：是针对文本表示的一种方法。文本表示可以进一步应用在文本

发表于NIPS2010 workshop on deep learning的一篇文章&＃xff0c;看得半懂。

主要内容&＃xff1a;

是针对文本表示的一种方法。文本表示可以进一步应用在文本分类和信息检索上面。通常&＃xff0c;一篇文章表示为V大小的一个向量&＃xff0c;|V|是词表的大小。传统的方法&＃xff0c;向量中每个值是tf/idf计算得到的权重。不过|V|比较大的时候&＃xff0c;对于文本分类和信息检索来讲&＃xff0c;时空复杂度都比较大。这时候需要对|V|进行降维。通常的方法是LDA系列的方法&＃xff0c;将文章表示成若干个topic上面的分布。不过实验效果并不好。本文作者用deep stack auto-encoders来做。

具体做法&＃xff1a;

构建deep stack auto-encoders。输入还是bag of words想法&＃xff0c;即用|V|的词语向量来做。向量的每个维度是词表中的词语&＃xff0c;取值采用了归一化的词语在文章中的出现次数&＃xff0c;对于没有出现在文章中的词语&＃xff0c;采用了类似ngram模型中的加法平滑&＃xff0c;也给一个很小的数值。在这种输入的情况下&＃xff0c;做auto-encoders&＃xff0c;来训练神经网络。隐含层的维数要远小于|V|&＃xff0c;从而达到降维的目的。在auto-encoders的基础上&＃xff0c;在训练分类器g&＃xff0c;以配合实际应用&＃xff0c;如&＃xff1a;文本分类。

注意&＃xff0c;这时候&＃xff0c;每个输入就是一篇文章&＃xff08;所形成的|V|维向量&＃xff09;&＃xff0c;输入的顺序是随机的&＃xff0c;即在文章集合中随机游走。另外&＃xff0c;auto-encoders的能量函数还可以再加上网络本身权重的L1或者L2范式。

用训练好的神经网络来计算test corpus中文章的迷惑度。

这个看的不是太懂。感觉大概是这样的过程&＃xff1a;把test corpus中的文章&＃xff0c;先表示成|V|的向量形式&＃xff0c;然后用训练好的deep stack auto-encoders进行encode和decode&＃xff0c;而decode的结果作为这篇文章在整个词语集合V上的词语概率分布&＃xff08;需要加入softmax层&＃xff09;&＃xff0c;在这个分布上&＃xff0c;就可以计算文章的迷惑度了。

在实验中&＃xff0c;这种计算出来的迷惑度比LDA&＃xff08;用相似过程&＃xff09;计算出来的迷惑度要小&＃xff0c;所以性能要高。

在实验中&＃xff0c;还用股市预测来验证auto-encoders&＃xff0c;即分析股市相关新闻的倾向性&＃xff0c;从而判断股票走向。写的不多&＃xff0c;没看懂具体怎么做的。

推荐阅读

神经网络
探索电路与系统的起源与发展

本文回顾了电路与系统的发展历程，从电的早期发现到现代电子器件的应用。文章不仅涵盖了基础理论和关键发明，还探讨了这一学科对计算机、人工智能及物联网等领域的深远影响。 ... [详细]

蜡笔小新 2024-12-24 13:57:05
tree
优化深度神经网络在低性能硬件上的运行

尽管深度学习带来了广泛的应用前景，其训练通常需要强大的计算资源。然而，并非所有开发者都能负担得起高性能服务器或专用硬件。本文探讨了如何在有限的硬件条件下（如ARM CPU）高效运行深度神经网络，特别是通过选择合适的工具和框架来加速模型推理。 ... [详细]

蜡笔小新 2024-12-24 08:48:32
tree
Coursera ML 机器学习

2019独角兽企业重金招聘Python工程师标准线性回归算法计算过程CostFunction梯度下降算法多变量回归![选择特征](https:static.oschina.n ... [详细]

蜡笔小新 2024-12-22 16:09:09
tree
亚马逊Go：无人零售的创新与挑战

本文探讨了亚马逊Go如何通过技术创新推动零售业的发展，以及面临的市场和隐私挑战。同时，介绍了亚马逊最新的‘刷手支付’技术及其潜在影响。 ... [详细]

蜡笔小新 2024-12-13 11:39:37
runtime
优化ListView性能

本文深入探讨了如何通过多种技术手段优化ListView的性能，包括视图复用、ViewHolder模式、分批加载数据、图片优化及内存管理等。这些方法能够显著提升应用的响应速度和用户体验。 ... [详细]

蜡笔小新 2024-12-28 10:36:30
input
卷积神经网络（CNN）基础理论与架构解析

本文介绍了卷积神经网络（CNN）的基本概念、常见结构及其各层的功能。重点讨论了LeNet-5、AlexNet、ZFNet、VGGNet和ResNet等经典模型，并详细解释了输入层、卷积层、激活层、池化层和全连接层的工作原理及优化方法。 ... [详细]

蜡笔小新 2024-12-24 18:58:11
rsa
智能车间调度研究进展

本文综述了基于强化学习的智能车间调度策略，探讨了车间调度问题在资源有限条件下的优化方法。通过数学规划、智能算法和强化学习等手段，解决了作业车间、流水车间和加工车间中的静态与动态调度挑战。重点讨论了不同场景下的求解方法及其应用前景。 ... [详细]

蜡笔小新 2024-12-22 19:02:54
rsa
机器学习核心概念与技术

本文系统梳理了机器学习的关键知识点，涵盖模型评估、正则化、线性模型、支持向量机、决策树及集成学习等内容，并深入探讨了各算法的原理和应用场景。 ... [详细]

蜡笔小新 2024-12-22 09:15:30
import
使用TensorFlow实现非线性回归模型

本文介绍了如何利用TensorFlow框架构建一个简单的非线性回归模型。通过生成200个随机数据点进行训练，模型能够学习并预测这些数据点的非线性关系。 ... [详细]

蜡笔小新 2024-12-20 11:54:20
import
深入浅出TensorFlow数据读写机制

本文详细介绍TensorFlow中的数据读写操作，包括TFRecord文件的创建与读取，以及数据集（dataset）的相关概念和使用方法。 ... [详细]

蜡笔小新 2024-12-19 16:23:17
import
山东高校教师职称改革：12位教师因绩效不佳被降级

近期，《学知报》发表了一篇关于威海职业学院教育改革进展的文章。文章指出，尽管一些改革措施仍在试验阶段，但该学院决心通过深化改革提升教学质量。 ... [详细]

蜡笔小新 2024-12-17 12:21:22
import
TWEN-ASR 语音识别入门：运行首个程序

本文详细介绍了如何使用TWEN-ASR ONE开发板运行第一个语音识别程序，包括开发环境搭建、代码编写、下载和调试等步骤。 ... [详细]

蜡笔小新 2024-12-17 11:03:50
object
2017年人工智能领域的十大里程碑事件回顾

随着2018年的临近，我们一同回顾过去一年中人工智能领域的重要进展。这一年，无论是政策层面的支持，还是技术上的突破，都显示了人工智能发展的迅猛势头。以下是精选的2017年人工智能领域最具影响力的事件。 ... [详细]

蜡笔小新 2024-12-16 17:59:16
input
游戏开发中的人工智能复习指南

本文档旨在帮助开发者回顾游戏开发中的人工智能技术，涵盖移动算法、群聚行为、路径规划、脚本AI、有限状态机、模糊逻辑、规则式AI、概率论与贝叶斯技术、神经网络及遗传算法等内容。 ... [详细]

蜡笔小新 2024-12-16 10:01:32
input
基于局部特征与整数规划的人群计数研究

本文深入探讨了《Crossing the Line: Crowd Counting by Integer Programming with Local Features》论文的核心技术与应用，包括ROI（感兴趣区域）和LOI（感兴趣线）的概念，以及HOG特征的详细解析。 ... [详细]

蜡笔小新 2024-12-14 11:01:09

醉苏芳华

这个家伙很懒，什么也没留下！

Tags | 热门标签

RankList | 热门文章