美文网首页深度学习
2020自然语言处理 BERT 模型(上)

2020自然语言处理 BERT 模型(上)

作者: zidea | 来源:发表于2020-03-10 20:27 被阅读0次
BERT

今天我们想到 NLP 就会想到 BERT,在 NLP 领域中 BERT 到处屠榜。BERT 主要应用于自然语言处理中的预训练。这里想说一件有趣的事,就是当下比较火的自然语言处理模型如 ElMo 和 BERT 都是动画片芝麻街中角色。

感谢李宏毅分享

hulkbuster.jpg

BERT(Bidirectional Encoder Representations from Transformers)

bert_cover.jpeg

那么什么是 BERT 呢? 我们先从字面上解释一下什么是 BERT。

  • Bidirectional : 是双向神经网络,这个在学习 RNN 时候我们就了解到如何使用双向 RNN 让每一个词视野更加广阔,不但可以看到其前面词还能看到后面的词
  • Encoder : 说明 BERT 是编码器
  • Representations : BERT 是完成词的表现的任务的模型
  • Transformer: 表示 BERT 结构没有采用 LSTM 这样 RNN 结构,而是采用了 Transformer 这样结构来实现双向循环神经网,Transformer 对象 LSTM 的优势是并行计算

想了解 Transformer 可以参照
2020机器学习 Transform 模型(1)
2020机器学习 Transform 模型(2)
2020机器学习 Transform 模型(3)

我们先用一句话来概括一下 BERTBERT 做的事情就是接受一个句子,会输出一个词的表示,这就是 BERT所做的事情。

bert_apply.jpeg

BERT = 就是 Transformer 的编码器(Encoder)部分。
BERT 只是 Transformer 一部分,他优势在于无需收集带有标签的数据集我们就可以训练一个 BERT

BERT 和 ELMo 关系

其实我们应该先介绍一下 ELMo ,因为我们只要将 ELMo 中的 LSTM 替换为 Transformer 就是 BERT。说以我们应该先介绍一下 ELMo。


bert_and_elmo.jpg bert_input.png

上面图是 BERT 输入,BERT 输入分为 3 个部分

  • Token Embedding: 在输入中有一些特殊字符[CLS]表示做分类任务,[SEP]表示句子之间间隔。这些大家不了解没有关系随后会详细介绍。为什么会有 [SEP] 呢,这是因为在训练 BERT 时候我们通常会输入 2 个句子,这两个句子间用 [SEP] 来进行分隔。
  • Segment EmBeddings: 这里E_AE_B 表示词(token)来自哪个句子 A 或是 B。这个应该不难理解
  • Position Embeddings E_1,E_2,\dots,E_{10} 表示词(token)在输入的位置

训练 BERT 方法有两种方式,也就是两种任务来进行 BERT 的训练

MLM(Masked Language Model)

类似完形填空,我们在输入句子的 15% 词用 [MASK] 来替换掉,然后 BERT 如何填补,通过对比填补内容是否正确作为目标。在 15% 词替换又分为以下 3 种情况

  • 80% 可能性会替换为[MASK]
  • 10% 可能性替换相似其他词
  • 10% 可能性会保持原样不动
mask_language_model.png

在值得注意时候在计算损失时候我们只针对[MASK]进行计算。
把[MASK]输入到一个线性多分类器(Linear Multi-class classifier) 能力很弱,如果成功预测出词汇,就说明 BERT 抽取很好词表示的向量。

NSP(Next Sentence Prediction)

在这个任务只要是判断前后两个句子是否有关联性。


next_sentence_prediction.jpg

给 BERT 输入两个句子,让 BERT 判断这两个句子是否有前后关联关系。这里需要引入[SEP] 词表示两个句子的分界线,[CLS] 通常放在输入序列第一个位置,[CLS]的输出给二分类的分类器(Linear Binary Classifier),这个线性分类器会给出分数。,大家可能认为 [CLS] 应该放在句尾,这里解释一下为什么放置序列首位,而不是其他位置。这是因为 BERT 内部使用 Transformer ,Transformer 中每一个位置都是均等的,给输入顺序无关,所以 [CLS] 可以放在任意位置。无论[CLS]放在句子开头还是放在结尾都是没有差别。

我们知道 BERT ,接下来看一看 BERT 应用。最简单应用就是根据我们任务让 BERT 作为提取特征工具提供一些词向量来作为使用。但是 paper 中还给出不止这些 BERT 应用。还有让 BERT 和你的模型一起训练

相关文章

  • 2020自然语言处理 BERT 模型(上)

    今天我们想到 NLP 就会想到 BERT,在 NLP 领域中 BERT 到处屠榜。BERT 主要应用于自然语言处理...

  • BERT 详解(一)

    今天来聊聊谷歌的自然语言处理框架 BERT,BERT 已经对自然语言处理有着显著的变革,那么 BERT 到底是什么...

  • BERT

    自然语言处理通用框架BERT原理解读 BERT任务目标概述 自然语言处理通用解决方案需要熟悉word2vec, R...

  • NLP模型应用之二:BERT

    引入 BERT是谷歌在2018年10月发布的自然语言处理模型,它在十一项自然语言任务中打破记录,在有些任务中有显著...

  • 【微博】从WordEmbedding到BERT模型

    演讲主题:预训练在自然语言处理的发展:从WordEmbedding到BERT模型 主讲人:张俊林 主讲人介绍: 张...

  • RoBERTa 和 ALBERT

    BERT 模型是 2018 年提出的,并在很多自然语言处理任务有前所未有的提升。因此 2019 年就有很多工作是围...

  • AI产品经理基础(五)-NLP领军模型BERT

    什么是BERT BERT是谷歌最新提出的语言模型,在处理NLP的各项任务上,这个通用模型基本完爆所有模型。可以说是...

  • 【技术综述】深度学习在自然语言处理中的应用发展史

    本篇介绍深度学习在自然语言处理(NLP)中的应用,从词向量开始,到最新最强大的BERT等预训练模型,梗概性的介绍了...

  • 配置BERT运行环境

    自然语言处理库Transformers包含了BERT、GPT、GPT-2、Transformer-XL、XLNet...

  • BERT 详解(四)

    BERT 有两个自然语言处理任务的预训练: Masked Language Modeling Next Sente...

网友评论

    本文标题:2020自然语言处理 BERT 模型(上)

    本文链接:https://www.haomeiwen.com/subject/ciirdhtx.html