解决占星杀手的 340 个字符密码
内容提要
该研究利用神经语言模型和经典密码算法成功解密美国国会图书馆的加密信件,解密成功率达到75.1%。研究探讨了字符分割和图像聚类等技术,并提出了新的解密方法,展示了机器学习在密码学中的应用。
延伸解读
解密方法的技术核心
该研究采用构建解码格和神经语言模型搜索格子的方法,对国会图书馆加密信件进行解密,成功率达到75.1%。这种方法将解密任务转化为在解码格中寻找最优路径的问题,利用神经语言模型评估候选解的可能性,从而有效缩小搜索空间。这体现了机器学习在经典密码分析中的实际应用价值。
字符分割与图像聚类的作用
研究运用无监督模型实现字符分割、图像聚类和破解密文,能够自动将手稿图像转化为文本。字符分割和图像聚类是处理历史手稿的关键步骤,因为手稿中的字符可能连笔或模糊,无监督方法可以减少人工干预,提高处理效率,为后续解密提供结构化数据。
非分段密码的自动分段突破
论文提出使用字节对编码和单元语言模型自动分段非分段密码,对100个随机生成的单字母替代密码平均分段错误率仅为2%,对3个现实中的同音替代密码平均错误率为27%。此外,通过创建晶格和训练语言模型解决已知替代密钥的非确定性密码,成功解密了历史密码IA,这是之前未被完全解开的密码。
解密任务的分类视角与评估
研究将解密任务视为分类问题,并在数据集上评估了各种tokenizer和模型组合的性能。这种视角将密码分析转化为机器学习中的分类任务,通过比较不同组合的效果,可以找出最适合特定密码类型的模型,为未来研究提供基准和方向。
Q&A
这项研究使用了哪些技术来解密加密信件?
研究使用了神经语言模型、经典密码算法、无监督模型、字符分割和图像聚类等技术。
解密成功率是多少?
解密成功率达到75.1%。
研究如何将解密任务视为分类问题?
研究将解密任务视为分类问题,并评估了各种tokenizer和模型组合的性能。
该研究提出了什么新的解密方法?
研究提出了一种使用字节对编码和单元语言模型自动分段非分段密码的方法。
研究中提到的字符分割技术有什么作用?
字符分割技术用于将手稿图像自动转化为文本。
该研究的主要贡献是什么?
主要贡献是展示了机器学习在密码学中的应用,成功解密历史密码并提高了解密效率。