【Transformer 与注意力机制】37|BERT:MLM、NSP 与 Encoder-only 路线的代价

💡 原文中文,约14300字,阅读约需34分钟。
📝

内容提要

本文深入剖析BERT架构的机制与证据:MLM的80/10/10掩码策略在微调与特征提取场景影响不同;NSP被RoBERTa质疑的证据链复杂,其必要性取决于输入打包方式;BERT作为马尔可夫随机场可用吉布斯采样生成文本,但代价高昂;后续如ModernBERT等仍在升级Encoder-only路线,因其在分类、检索等任务上仍有成本优势。

🔎

延伸解读

80/10/10 掩码策略的真正价值场景

BERT 论文的消融实验显示,在端到端微调场景下,不同掩码比例组合的 MNLI 分数差异很小(83.6-84.4),说明微调过程本身能缓解预训练与微调之间的不匹配。但在冻结编码器做特征提取时,80/10/10 策略的优势明显(94.9 vs 94.0),这提示当前大量 embedding、检索场景中,该策略仍具实际意义。

NSP 争论的严谨解读

RoBERTa 的四组对照实验同时改变了输入打包格式和训练目标,并未单独隔离 NSP 的影响。更准确的结论是:当输入为连续多句时,NSP 的边际收益消失,而非 NSP 本身无用。因此,简单断言“RoBERTa 证明 NSP 没用”会掩盖输入格式这一混淆变量,需谨慎引用。

BERT 生成文本的代价结构

BERT 可通过 Gibbs 采样生成文本,但每轮需对整段序列重新计算 attention,且收敛轮数无上界,与自回归生成的增量前向和 KV Cache 优化完全不同。因此,虽然数学上可行,但工程上无生产级应用,这解释了为何“BERT 不能生成”的说法需限定为“工程上不实用”。

Encoder-only 路线的持续生命力

ModernBERT 等 2024 年后工作表明,Encoder-only 模型仍在被系统性现代化,通过引入 RoPE、GeGLU 等改进,在分类、检索等任务上保持成本优势。同时,DistilBERT 等蒸馏模型在延迟敏感场景中广泛应用,说明该路线并未被 Decoder-only 淘汰,而是分工明确。

Q&A

BERT的MLM预训练中80/10/10掩码策略具体是什么?为什么这样设计?

BERT在预训练时随机遮盖15%的WordPiece token,其中80%替换为[MASK],10%替换为随机token,10%保持不变。这样设计是为了让模型不知道每个位置是否被替换,从而迫使它对每个输入位置都保持一个分布式的上下文表示,缓解预训练和微调阶段输入分布不一致的问题。

BERT的80/10/10掩码策略在微调和特征提取两种场景下的效果有何不同?

在端到端微调场景下,80/10/10策略与其它掩码组合(如全部用[MASK])在下游任务上的效果差异很小(MNLI分数在83.6到84.4之间)。但在冻结编码器做特征提取时,80/10/10策略的优势明显,例如在NER任务上达到94.9,高于全部用[MASK]的94.0。这说明80/10/10策略主要缓解了预训练-微调不匹配问题,尤其在特征提取场景下价值更大。

为什么说BERT不能自然生成文本?它真的完全不能生成吗?

BERT不能像自回归模型那样自然生成文本,因为它的双向注意力机制使得每个位置都能看到上下文,无法直接预测下一个词。但BERT在数学上等价于一个马尔可夫随机场语言模型,可以通过吉布斯采样生成文本,只是生成质量略差且计算代价高昂,没有生产级应用。因此,准确说法是“数学上可以生成,但工程上没人这么用”。

RoBERTa的实验是否证明了NSP无用?为什么?

RoBERTa的实验并没有单独证明NSP无用。它的四组对照实验同时改变了输入打包格式和训练目标,无法单独归因。更准确的结论是:当输入是连续多句的长文本时,NSP的边际收益消失。因此,不能说NSP设计错了,只能说其必要性取决于输入打包方式。

为什么BERT适合分类、匹配和抽取式问答等任务?

BERT采用Encoder-only架构,一次前向即可获得所有token的全局上下文表示,非常适合需要整体理解的任务。例如,抽取式问答中,BERT可以直接利用每个位置的全局表示预测答案跨度,而自回归模型需要完整扫描序列才能获得等价信息,导致性能下降。

ModernBERT在哪些方面对BERT进行了改进?

ModernBERT将RoPE位置编码、GeGLU前馈层、局部/全局交替注意力等现代架构改进引入Encoder-only模型,训练语料扩大到2万亿token,支持8192 token的上下文长度,在GLUE上刷新了纪录,并在长文本检索和代码检索上取得最好结果。

为什么Encoder-only模型在生成式AI时代仍然被部署?

Encoder-only模型在分类、检索、重排等任务上仍有成本优势,因为一次前向即可获得全局表示,而生成模型需要自回归解码,成本更高。此外,蒸馏版本如DistilBERT在延迟和显存敏感场景中应用广泛。ModernBERT的出现也证明该路线仍在被现代化。

BERT的fine-tuning范式有哪些脆弱性?

BERT的fine-tuning对学习率、batch size、epoch数、随机种子等超参数敏感,在小数据集上微调结果方差可能很大。论文报告的多是多次随机重启的平均或中位数,生产环境单次微调可能偏离中位数。

🏷️

标签

➡️

继续阅读