TOKEN的最佳翻译

💡 原文中文,约2800字,阅读约需7分钟。
📝

内容提要

文章主张大语言模型术语 token 的最佳中文译名是「模型字」,简称「字」。作者认为「词元」的「词」有误导性、「元」抽象、读音平且无法简称;「模元」虽去掉「词」,仍受限于「元」,难以构词。而「字」已有「机器字」「字长」等先例,指可识别、计数、处理的最小单位,可构成字窗口、字嵌入、下一字预测等术语,结构自然、能产性强。

🔎

延伸解读

术语翻译的能产性考量

文章指出,术语翻译不仅要准确,还要考虑其构词能力。一个术语若能简称并衍生出系列词汇,将极大便利技术传播。「模型字」可简称「字」,从而生成字窗口、字嵌入、下一字预测等术语,而「词元」「模元」因无法简称,构词生硬,限制了表达。这提醒我们,在引入新术语时,能产性往往比字面简洁更重要。

「字」在计算机术语中的先例

作者以「机器字」「字长」「字节」为例,说明中文「字」在计算机领域早已不限于汉字,而是指可识别、计数、处理的最小单位。将「字」用于大模型,与CPU按字长处理数据同构,逻辑自然。这有助于消除「字即汉字」的误解,为「模型字」的合理性提供支撑。

歧义消解与语境适应

针对「字」可能被误解为汉字的担忧,文章类比英文token的多义性(词法记号、访问令牌、代币等),指出英文通过限定词消歧,中文同样可用「模型」限定。正式场合使用「模型字」,简称「字」,类似CPU语境中说「字长」不会误解为汉字。这种策略平衡了简洁与准确。

❓

Q&A

为什么说「词元」这个翻译不好?

「词元」的「词」有误导性,因为 token 不一定是词,可能是半个词、多个词、空格、标点、emoji 或半个汉字;「元」太抽象,没有具体形象;读音平直,缺少重音;不能简称,搭配生硬;还容易和已有词法术语混淆。

「模元」和「词元」相比有什么改进和不足?

「模元」把「词」换成「模」,切断了 token 是词的错误预设,比「词元」好一点。但它仍卡在「元」上,「元」依然抽象,且「模元」没法简称,导致无法构词,比如「下一模元」「多模元」又长又拗口。

为什么「模型字」是 token 的最佳翻译?

「模型字」结构自然(模型限定,字为中心语),有「机器字」「字长」等先例,其中「字」指可识别、计数、处理的最小单位;可简称「字」,能产性强,能构成字窗口、字嵌入、下一字预测等术语;有歧义时可用「模型」收束;语感像母语。

「模型字」的「字」和汉字有什么关系?

没有关系。「字」在计算机术语中早有先例,如「字长」「机器字」「字节」,指被识别、计数、处理的最小单位,与汉字无关。模型字是模型词表里的离散符号 ID,是模型读写文本的最小单位,就像 CPU 一次处理一个字长,LLM 一次生成一个 token。

「模型字」在实际使用中如何简称和构词?

首次出现写「模型字」,之后可简称「字」。可以构成字窗口、字嵌入、字化、字表、按字计费、下一字预测、多字预测等术语,构词自然且能产性强。

token 在中文里还有哪些其他译名?它们各自有什么问题?

常见译名有「词元」和「模元」。「词元」的「词」误导、「元」抽象、不能简称;「模元」虽去掉了「词」,但仍受限于「元」,无法简称和构词。文章认为最佳译名是「模型字」。

🏷️

标签

➡️

继续阅读