复习笔记概览
包含 NLP 的基本概念介绍以及其他笔记的目录索引
笔记目录
基本概念
$$ \text{NLP} \rightarrow \text{CL} \rightarrow \text{NLU} $$三种不同的语系:
- 屈折语:通过词形变化来表达语法关系,如英语、德语等
- 黏着语:通过词缀来表达语法关系,如日语、韩语等
- 孤立语:词形不变,语法关系通过词序和虚词来表达,如汉语、越南语等
MT 发展历程
- 1950s前: 基于模版的 MT
- 1960s-1990s: 基于规则的 MT (规则、词典、算法)
- 1990s-2013s: 基于统计的 MT (语料、特征、模型)
- 2013s-现在: 基于神经网络的 MT (语料、模型)
NLP 研究内容 可以划分成四种类别
- 分类:文本分类、情感分类、文本匹配、文本蕴含
- 序列标注:中文分词、词性标注、信息抽取、槽位填充
- 生成:机器翻译、文本摘要、风格迁移、自动问答、对话系统
- 结构预测:序列分割、句子分割、段落分割、句法分析
NLP 研究基本问题
- 问题一:形态学 Morphology,研究词如何由词素组成
- 问题二:句法学 Syntax,研究词如何组合成句子
- 问题三:语义学 Semantics,研究句子如何表达意义
- 问题四:语用学 Pragmatics,研究句子如何在上下文中使用
- 问题五:语音学 Phonetics,研究语言的声音系统
NLP 研究困难:歧义 ambiguity
存在词法歧义、词性歧义、结构歧义、语义歧义、语音歧义
Catalan Number:$C_n = \frac{1}{n+1}\binom{2n}{n} = \frac{(2n)!}{(n+1)!n!}$
一个包含 N 个成分的句子(N-1 个介词短语),它可能的组合数为 $C_{N-1}$
统计机器翻译
$$ \hat{C} = \arg\max_C P(C|S) = \arg\max_C P(S|C)P(C) $$前一个是翻译模型,后一个是语言模型(可以是n-gram模型等)
神经机器翻译
$$\begin{aligned} \hat{C} & = \arg\max_C \prod_{t=1}^{T} P(c_t|c_1,\ldots,c_{t-1},S) \\ &= \arg\max_C \sum_{t=1}^{T} \log P(c_t|c_1,\ldots,c_{t-1},S) \end{aligned}$$