本文分析BERT、GPT、T5三种架构的根本差异在于注意力掩码决定的“可见性图”,此图训练后不可变。Decoder-only虽在通用生成上占优,但并非表示能力更强,而是统一了训练与推理管线。推理系统如KV Cache等默认单流因果结构,Encoder-Decoder需额外处理。在分类、检索等任务上,Encoder模型仍更高效,生成式方案并非万能。
完成下面两步后,将自动完成登录并继续当前操作。