Token 应译作「符」

Token 应译作「符」

💡 原文中文,约7300字,阅读约需18分钟。
📝

内容提要

Token在中文翻译中常被误译为“词元”,但其含义因领域而异:桌游中指指示物,密码学中指令牌,编译器中指词法记号,NLP中可指字符、词语或句子,LLM中则指字节对编码。作者认为“词元”仅适用于词法分析,建议统一译为“符”,因其本义为“指示另一实体的符号”,更贴合各领域用法。

🔎

延伸解读

「词元」译法为何不准确

文章指出,Token 在计算机科学的不同领域有不同含义:桌游中为指示物,密码学中为令牌,编译器中为词法记号,NLP 中可为字符、词语或句子,LLM 中则是字节对编码。将所有这些统一译为「词元」并不恰当,因为「词元」仅适用于词法分析场景,且容易与 word 混淆。

Token 的跨领域共性

作者认为,Token 的本义是「指示另一实体的符号」,这一共性贯穿所有领域:桌游指示物指示游戏状态,密码学令牌指示访问权限,词法记号指示语言单元,LLM 的 Token 指示字节对及其统计特征。因此,建议统一译为「符」,以涵盖其多样化的应用场景。

LLM 中的 Token 并非「词」

文章强调,大语言模型使用的字节对编码(BPE)是在字节层面操作,生成的 Token 可能不是有意义的词语,甚至包含特殊字符。因此,将 LLM 的 Token 译为「词元」会误导读者,使其误以为 Token 对应自然语言中的词。

Q&A

Token在桌游中通常翻译成什么?

在桌游中,Token通常翻译为“指示物”,有时也根据情况译作“代币”或“标记”。例如,大富翁中标记地产的房子、飞行棋里的飞机、龙与地下城中的角色小人,都称为Token。

密码学中的Token指的是什么?

密码学中的Token通常称为“令牌”,是服务端在客户端验证身份后生成的凭证,通常是一串字符串,客户端在后续请求中携带它来证明身份,无需重复输入密码。常见的例子是JWT,它通常存放在Cookies或HTTP请求头中。

编译器和解释器中的Token是什么?

在编译器和解释器中,Token是词法分析阶段产生的词法记号,是源代码字符串被划分成的最小有意义的语言单元,如括号、关键字、字面量等。例如,在解析Lisp表达式时,tokenize函数会将字符串拆分成一个个Token,供后续语法分析使用。

自然语言处理中的Token有哪些类型?

在自然语言处理中,Token可以是字符、词语、句子或N元组,具体取决于分词方法。例如,字符分词、子词分词、句分词和N元分词等。这些方法用于将文本分割成处理单元,但并非所有Token都是词。

大语言模型中的Token是如何生成的?

大语言模型使用字节对编码(BPE)将文本转换为Token。BPE算法将频繁出现的字节对替换为未使用的字符,递归进行,最终将字符序列映射为自然数,这些自然数即为Token。例如,字符串'aaabdaaabac'经过BPE编码后可能变成数字序列。

为什么作者认为Token应译作「符」?

作者认为Token的本义是“指示另一个实体的符号”,而“符”在中文中恰好表示“指示某个东西的东西”,如兵符、令牌等。Token在不同领域都指代一种符号或凭证,而“词元”仅适用于词法分析,无法涵盖其他含义,因此建议统一译为“符”。

Lemma在语言学中是什么意思?

Lemma在语言学中通常译为“词目”或“词元”,指词典中的规范形式,如英语动词go的词典形式是go,而went、gone等是变位形式。它用于将词语的变体归并到同一词条下。

🏷️

标签

➡️

继续阅读