内容提要
本文探讨了日语因敬语和分词器效率低,导致AI使用成本远高于英语,最高达7倍。文章分析了分词器对日文切分碎片化、敬语文化增加输入输出长度,并介绍了Sakana AI、乐天等公司通过优化模型、压缩工具和分词器来降低成本。最后,文章将日语敬语与印度种姓制度、伊朗塔洛夫文化类比,指出语言本质是定位社会关系的工具。
延伸解读
token计费背后的语言不平等
文章揭示了一个常被忽视的事实:AI按token收费,而token消耗量取决于分词器对语言的切分效率。由于训练数据以英文为主,日文等非英语语言被切得更碎,导致相同语义下token数远高于英文。这种“语言税”并非模型故意歧视,而是数据分布和技术局限的必然结果。对用户而言,这意味着使用非英语语言与AI交互时,成本天然更高,且对话越短,差距越明显。
敬语为何让AI“失控”
AI在处理日语敬语时表现出的“敬语核弹”现象,根源在于其缺乏对社交语境的真实理解。敬语系统精密地标记着上下、内外、亲疏关系,而AI只是学习了词汇共现模式,无法像人类一样根据场合调节礼貌程度。因此,当用户要求“爆敬语”时,AI会机械地堆砌最高级礼貌表达,产生荒谬结果。这提醒我们,AI的语言能力仍停留在表面,深层文化语用规范难以被模型自动习得。
降本增效的三种路径
针对日语token效率低的问题,业界已从三个方向着手:一是开发针对日语优化的专属模型,如Sakana AI的Sakana Namazu,通过后训练提升日语处理能力且不涨价;二是直接压缩输入,如genshijin工具可削减约75%的敬语等冗余token;三是改进分词器,如Preferred Networks自研的日语高效分词器。这些努力表明,非英语语言的AI成本问题正被重视,未来有望缩小语言间的差距。
Q&A
为什么日语使用AI的成本比英语高?
主要原因是日语在分词器中被切分成更多token,加上敬语文化导致输入输出更长。例如,英文“Thank you”算1个token,而日文“ありがとうございます”被拆成7个token,成本最高可达7倍。
分词器是如何影响AI对不同语言的收费的?
分词器使用字节对编码,根据训练数据中字符组合的频率来切分文本。英文在训练数据中占比高,常见组合被压缩成单个token;而日文因缺乏空格和训练数据少,常被拆到单字符级别,导致token消耗高。
什么是“敬语核弹级灾难”?
指AI在生成敬语时过度使用,导致输出荒谬可笑。例如,有网友让ChatGPT写“爆敬语”的商务邮件,结果AI使用了“宇宙级的歉意”“恳请您炸裂一下”等夸张表达,甚至出现“かしこまりボンバー”这样的怪词。
AI在处理日语敬语时存在哪些问题?
AI缺乏“社会脑”,无法根据语境调节敬语程度,导致过度使用或误用。研究指出,主流大模型在处理日语敬语时存在大量典型偏误,无法稳定复现母语者的语用规范。
有哪些公司或工具在优化日语AI的token效率?
Sakana AI推出了Sakana Namazu API,针对日语和日本商业文化优化;乐天扩展了RakutenAI-7B的词汇表;开源社区开发了genshijin工具,可压缩敬语等冗余表达;Preferred Networks在PLaMo 3.0 Prime中使用了自研分词器。
genshijin工具是如何节省token的?
genshijin通过砍掉日语中的敬语、礼貌用语、填充词和缓冲表达来减少token消耗,官方称可减少约75%的token。它提供礼貌、正常、极限三个档位,极限模式下AI输出只保留技术内容。
日语敬语与印度种姓制度有何相似之处?
两者都是通过语言来划定社会关系和权力距离的工具。敬语通过选择不同表达方式标记上下、内外、亲疏;种姓制度通过词汇和语法标记洁净与不洁。维特根斯坦认为,它们都是语言现象,本质是语言如何划定“谁可以对你做什么”的边界。
日语敬语与伊朗的塔洛夫文化有何共同点?
两者都是一种社会“操作系统”,核心是定位人与人之间的社会关系,而非传递信息。它们都通过“抬举对方、贬低自己”等方式维系秩序、表达尊重,是语言的重要用法。