该研究提出了一种使用自我聊天机制生成高质量、语言特定的聊天语料库的新方法。研究者结合了生成器和嵌入器,提出了一种基于蒙板语言模型的质量评估度量方法。他们生成了意大利聊天语料库,并改进了基于翻译的英语聊天数据的Fauno语料库。使用这些语料库来微调意大利LLM可以提升语言理解和问答能力。这种方法对于发展语言特定LLM具有重要意义,特别是对于支持少数语言如意大利语的语料库。
完成下面两步后,将自动完成登录并继续当前操作。