包含关键字变分自编码器的文章 - 科学空间|Scientific Spaces

19 Nov

更别致的词向量模型(三)：描述相关的模型

By 苏剑林 | 2017-11-19 | 130168位读者 | 引用

几何词向量

上述“月老”之云虽说只是幻想，但所面临的问题却是真实的。按照传统NLP的手段，我们可以统计任意两个词的共现频率以及每个词自身的频率，然后去算它们的相关度，从而得到一个“相关度矩阵”。然而正如前面所说，这个共现矩阵太庞大了，必须压缩降维，同时还要做数据平滑，给未出现的词对的相关度赋予一个合理的估值。

在已有的机器学习方案中，我们已经有一些对庞大的矩阵降维的经验了，比如SVD和pLSA，SVD是对任意矩阵的降维，而pLSA是对转移概率矩阵 $P(j|i)$ 的降维，两者的思想是类似的，都是将一个大矩阵 $\boldsymbol{A}$ 分解为两个小矩阵的乘积 $\boldsymbol{A}\approx\boldsymbol{B}\boldsymbol{C}$ ，其中 $\boldsymbol{B}$ 的行数等于 $\boldsymbol{A}$ 的行数， $\boldsymbol{C}$ 的列数等于 $\boldsymbol{A}$ 的列数，而它们本身的大小则远小于 $\boldsymbol{A}$ 的大小。如果对 $\boldsymbol{B},\boldsymbol{C}$ 不做约束，那么就是SVD；如果对 $\boldsymbol{B},\boldsymbol{C}$ 做正定归一化约束，那就是pLSA。

但是如果是相关度矩阵，那么情况不大一样，它是正定的但不是归一的，我们需要为它设计一个新的压缩方案。借鉴矩阵分解的经验，我们可以设想把所有的词都放在 $n$ 维空间中，也就是用 $n$ 维空间中的一个向量来表示，并假设它们的相关度就是内积的某个函数（为什么是内积？因为矩阵乘法本身就是不断地做内积）：
$\frac{P(w_i,w_j)}{P(w_i)P(w_j)}=f\big(\langle \boldsymbol{v}_i, \boldsymbol{v}_j\rangle\big)\tag{8}$
其中加粗的 $\boldsymbol{v}_i, \boldsymbol{v}_j$ 表示词 $w_i,w_j$ 对应的词向量。从几何的角度看，我们就是把词语放置到了 $n$ 维空间中，用空间中的点来表示一个词。

因为几何给我们的感觉是直观的，而语义给我们的感觉是复杂的，因此，理想情况下我们希望能够通过几何关系来反映语义关系。下面我们就根据我们所希望的几何特性，来确定待定的函数 $f$ 。事实上，glove词向量的那篇论文中做过类似的事情，很有启发性，但glove的推导实在是不怎么好看。请留意，这里的观点是新颖的——从我们希望的性质，来确定我们的模型，而不是反过来有了模型再推导性质。

机场-飞机+火车=火车站

点击阅读全文...

分类：信息时代标签：词向量, glove 阅读全文 27 评论

25 Nov

果壳中的条件随机场(CRF In A Nutshell)

By 苏剑林 | 2017-11-25 | 124839位读者 | 引用

本文希望用尽可能简短的语言把CRF（条件随机场，Conditional Random Field）的原理讲清楚，这里In A Nutshell在英文中其实有“导论”、“科普”等意思（霍金写过一本《果壳中的宇宙》，这里东施效颦一下）。

网上介绍CRF的文章，不管中文英文的，基本上都是先说一些概率图的概念，然后引入特征的指数公式，然后就说这是CRF。所谓“概率图”，只是一个形象理解的说法，然而如果原理上说不到点上，你说太多形象的比喻，反而让人糊里糊涂，以为你只是在装逼。（说到这里我又想怼一下了，求解神经网络，明明就是求一下梯度，然后迭代一下，这多好理解，偏偏还弄个装逼的名字叫“反向传播”，如果不说清楚它的本质是求导和迭代求解，一下子就说反向传播，有多少读者会懂？）

好了，废话说完了，来进入正题。

逐标签Softmax

CRF常见于序列标注相关的任务中。假如我们的模型输入为 $Q$ ，输出目标是一个序列 $a_1,a_2,\dots,a_n$ ，那么按照我们通常的建模逻辑，我们当然是希望目标序列的概率最大
$P(a_1,a_2,\dots,a_n|Q)$
不管用传统方法还是用深度学习方法，直接对完整的序列建模是比较艰难的，因此我们通常会使用一些假设来简化它，比如直接使用朴素假设，就得到
$P(a_1,a_2,\dots,a_n|Q)=P(a_1|Q)P(a_2|Q)\dots P(a_n|Q)$

点击阅读全文...

分类：信息时代标签：模型, 概率图, crf 阅读全文 24 评论

31 Dec

2018年全年天象

By 苏剑林 | 2017-12-31 | 28974位读者 | 引用

Astronomy Calendar of Celestial Events
2018年全年天象

翻译自NASA：http://eclipse.gsfc.nasa.gov/SKYCAL/SKYCAL.html

（北京时间）

分类：天文探索标签：天象, 天文阅读全文抢沙发

29 Jan

网站更新记录（2018年01月）

By 苏剑林 | 2018-01-29 | 32672位读者 | 引用

也许读者会发现，这几天访问科学空间可能出现不稳定的情况，原因是我这几天都在对网站进行调整。

这次的调整幅度很大，不过从外表上可能很难发现，特此记录留念一下。主要的更新内容包括：

1、主题的优化：本博客用的geekg主题其实比较老了，去年花钱请人对它进行了第一次大升级，加入了响应式设计，这几天主要解决该主题的一些历史遗留问题，包括图片显示、边距、排版等细微调整；
2、内部的优化：大幅度减少了插件的使用，把一些基本的功能（如网站目录、归档页）等都内嵌到主题中，减少了对插件的依赖，也提升了可用性；
3、文章的优化：其实这也是个历史遗留问题，主要是早期写文章的时候比较随意，html代码、公式的LaTeX代码等都不规范，因此早期的文章显示效果可能比较糟糕，于是我就做了一件很疯狂的事情——把800多篇文章都过一遍！经过了两天多的时间，基本上修复了早期文章的大部分问题；
4、域名的优化：网站全面使用https！网站放在阿里云上面，可是阿里云有一套自以为是的监管系统，无故屏蔽我的一些页面。为了应对阿里云的恶意屏蔽，只好转向https，当然，这不会对读者平时访问造成影响，因为跳转https是自动的。目前两个域名spaces.ac.cn和kexue.fm都会自动跳转到https。

分类：生活/情感标签：网站阅读全文 3 评论

16 Mar

现在可以用Keras玩中文GPT2了（GPT2_ML）

By 苏剑林 | 2020-03-16 | 103950位读者 | 引用

前段时间留意到有大牛开源了一个中文的GPT2模型，是最大的15亿参数规模的，看作者给的demo，生成效果还是蛮惊艳的，就想着加载到自己的bert4keras来玩玩。不过早期的bert4keras整体架构写得比较“死”，集成多个不同的模型很不方便。前两周终于看不下去了，把bert4keras的整体结构重写了一遍，现在的bert4keras总能算比较灵活地编写各种Transformer结构的模型了，比如GPT2、T5等都已经集成在里边了。

GPT2科普

GPT，相信很多读者都听说过它了，简单来说，它就是一个基于Transformer结构的语言模型，源自论文《GPT：Improving Language Understanding by Generative Pre-Training》，但它又不是为了做语言模型而生，它是通过语言模型来预训练自身，然后在下游任务微调，提高下游任务的表现。它是“Transformer + 预训练 + 微调”这种模式的先驱者，相对而言，BERT都算是它的“后辈”，而GPT2，则是GPT的升级版——模型更大，训练数据更多——模型最大版的参数量达到了15亿。

点击阅读全文...

分类：信息时代标签：语言模型, NLP, 文本生成, attention 阅读全文 31 评论

31 May