Transformer 诞生前夜:Google 八名研究者为何敢彻底抛弃循环神经网络?

BiRun 消息,作者:Robonaissance 编译:深潮 TechFlow 深潮导读: 2017 年之前,所有人都认为循环神经网络是机器翻译的必需品,注意力机制只是辅助工具。Google 八个研究者押注一个激进想法:把拐杖扔掉,只留注意力。这场豪赌的理论基础,其实是 1890 年威廉·詹姆斯在《心理学原理》里写下的一句话。 1985 年,Jeffrey Moran 和 Robert Desimone 把一根微电极插入猕猴的视觉皮层,然后等待。 这只猴子被训练做一件简单而奇怪的事。两个刺激物会出现在单个神经元的感受野内,一个位于动物被提示要注意的位置,另一个位于被告知要忽略的位置。这个细胞能看到两者。问题是这个细胞在不在乎。 它非常在乎。当猴子注意到两个刺激物中的一个时,V4 区的神经元反应大致就像另一个刺激物根本不存在一样。对未被注意物体的反应,用作者的话说,被显著降低了。前一阶段纹状皮层的细胞则完全没有这种表现。注意力不是动物在想什么的隐喻。它是单个细胞中可测量的事件,其机制是减法。大脑不是在放大重要的东西。它是在压低其他所有东西。 95 年前,没有微电极也没有猴子,威廉·詹姆斯用同样的顺序说过同样的话。在《心理学原理》第十一章,他写道每个人都知道注意力是什么,然后还是给了定义:心智从几个同时可能的对象中占有其中一个。然后是最重要的那句话。詹姆斯写道,注意力意味着从某些事物中撤出,以便有效地处理其他事物。 撤出。不是放大。这个领域最古老的定义和第一个单细胞记录一致认为,注意力就是你减去的东西。 记住这个想法。大约两千字后它会回来,穿着不同的符号。 所有人都同意付出的代价到 2016 年,机器翻译已经定型。你拿一个句子,通过循环神经网络逐词运行,积累一个隐藏状态来承载迄今为止看到的所有东西,然后用那个状态在另一端逐词生成翻译。主流变体是 LSTM 和门控循环单元。它们有效。谷歌已经将其投入生产。 这个架构有一个特性,领域内不断讨论却不再把它当问题。循环模型将位置 t 的隐藏状态计算为位置 t 减一的隐藏状态的函数。这不是实现细节。这是定义。位置五必须等位置四存在才能计算,位置四必须等位置三存在。 Transformer 论文自己的引言部分以不寻常的直白陈述了后果——对于一个本该客套的章节来说。作者写道,这种固有的顺序性质排除了训练样本内的并行化,而且这个问题在更长的序列长度时变得关键,因为内存限制了你可以批处理多少样本来补偿。 想想这在房间里的硬件是 GPU 时意味着什么。GPU 是一台同时做几千件事的机器。循环网络是一台一件接一件做事的机器。在前者上运行后者就像雇了一个管弦乐队却给他们一首为独奏小提琴写的曲子。所有人都到了。大多数人在等待。 这个领域知道。有修复方法。论文引用了因式分解技巧和条件计算,两者都提高了效率,其中一个也提高了质量。然后它给出了设定后续一切的句子:然而,顺序计算的基本约束仍然存在。 这就是一个领域把成本定价到其世界观中的样子。没人认为循环是免费的。所有人都认为它是必要的。 注意力到来,作为帮手注意力在 2014 年进入机器翻译,它以修复的身份进入。 它修复的问题是具体的,值得精确说明,因为这第一个修复的形态决定了这个领域接下来三年如何思考注意力。在当时的编码器-解码器模型中,编码器读取整个源句子并将其压缩成单个固定长度的向量。解码器然后仅从该向量生成翻译。一个四十词句子的每个词都必须存活在一个数字数组中,其大小无论句子多长都不会改变。 当时在不莱梅雅各布大学的 Dzmitry Bahdanau,与蒙特利尔的 Kyunghyun
利多 查看原文
你怎么看这条消息?来投第一票
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯