LDA主题模型介绍详解大数据

LDA（Latent Dirichlet Allocation）是一种文档主题生成模型，也称为一个三层贝叶斯概率模型，包含词、主题和文档三层结构。LDA是一种非监督机器学习技术，可以用来识别大规模文档集（document collection）或语料库（corpus）中潜藏的主题信息。它采用了词袋（bag of words）的方法，这种方法将每一篇文档视为一个词频向量，从而将文本信息转化为了易于建模的数字信息。每一篇文档代表了一些主题所构成的一个概率分布，而每一个主题又代表了很多单词所构成的一个概率分布。

对于语料库中的每篇文档，LDA定义了如下生成过程（generativeprocess）：

1.对每一篇文档，从主题分布中抽取一个主题；

2.从上述被抽到的主题所对应的单词分布中抽取一个单词；

3.重复上述过程直至遍历文档中的每一个单词。

语料库中的每一篇文档与T（通过反复试验等方法事先给定）个主题的一个多项分布（multinomialdistribution）相对应，将该多项分布记为。每个主题又与词汇表（vocabulary）中的V个单词的一个多项分布相对应，将这个多项分布记为beta。

图2: LDA的图模型表示

对于模型的求解问题，大致有三种方法：一种是基于Gibbs采样的方法、一种是基于期望推进的方法，另一种是基于变分法的EM求解。

原创文章，作者：ItWorker，如若转载，请注明出处：https://blog.ytso.com/9511.html

LDA主题模型介绍详解大数据

相关推荐

发表回复