文本分类
文本分类 文本分类的部分主要分成三个内容:文本表示、特征选择、分类算法 1. 文本表示 首先介绍 向量空间模型(Vector Space Model, VSM),它将文本表示为向量的形式,通常使用 词袋模型(Bag of Words, BOW) 来表示文本 文本表示的一个重要问题就是如何计算特征项权重,即每个词袋元素的权重是多少 布尔变量 是一个简单的方法 词频率 TF $$ w_i = \log(tf_i + 1) $$逆文档频率 IDF:一个词的 df 越小,说明它越能区分不同的文档,权重就应该越大 $$ idf_i = \log \frac{N}{df_i} \quad N \text{ 是文档总数,} df_i \text{ 是包含词 } i \text{ 的文档数} $$TF-IDF $$ w_i = tf_i \cdot idf_i $$2. 特征选择 用于文本分类的特征选取准则有很多,一个常用的指标是 DF 文档频率 $$ P(c_j|t_i) \approx \frac{A_{ij}}{\sum_{j=1}^{k} A_{ij} + C} \quad C \text{ 是类别数} $$而更常用的指标是 信息增益(Information Gain, IG),它衡量了一个特征对分类结果的不确定性减少的程度 ...