SAIR开放数学模型计划

SAIR开放数学模型计划

💡 原文英文,约1000词,阅读约需4分钟。
📝

内容提要

陶哲轩宣布,其联合创办的SAIR基金会启动“开放模型”计划,联合学界与业界开发科学开源大模型及工具。首阶段聚焦数学研究,包括理解论证、验证引用、编写代码和形式化证明。模型权重、代码和训练方法将开放,数据使用需经同意,社区主导治理,欢迎各方以资金、算力或专业知识参与。

🔎

延伸解读

计划加速发布的背景

陶哲轩在博文中提到,SAIR原本计划在未来几个月内逐步推出试点项目,但鉴于当前事件和对开放模型的高需求,决定加速时间表,提前发布初始公告。这表明外部环境的变化促使基金会调整策略,以更快响应社区对开放科学模型的期待。

开放许可与社区治理

根据公告,模型权重、代码和训练方法将开放,并采用Apache 2.0、MIT或CC BY 4.0等许可。数据使用需经用户明确同意,社区主导治理,决策公开透明。这些原则旨在确保研究独立性和可复现性,同时保护贡献者的权益。

首阶段聚焦数学任务

计划首阶段专注于日常数学工作,包括理解困难论证、检查引用、探索示例、编写代码和形式化证明。模型价值将通过可靠协助、可验证结果和持续使用成本来衡量。这有助于提升数学研究效率,并推动形式化证明等领域的进展。

社区反馈与许可讨论

公告发布后,有评论建议代码应采用AGPLv3而非Apache许可,认为在私人资助且AI行业冲击学术的背景下,强自由软件许可更能保障公众利益。这反映了社区对许可选择的关注,可能影响后续决策。

Q&A

SAIR开放数学模型计划是什么?

SAIR开放数学模型计划是由陶哲轩联合创办的SAIR基金会发起的一项倡议,旨在联合学术界和产业界共同开发科学开源大模型及工具。首阶段聚焦数学研究,包括理解论证、验证引用、编写代码和形式化证明。

SAIR开放模型计划为什么提前宣布?

因为当前事件和对开放模型的高需求,SAIR决定加速时间表,将原计划的逐步推出提前至今日宣布,尽管一些关键规划仍在进行中。

SAIR开放模型计划第一阶段关注哪些数学工作?

第一阶段关注日常数学工作:理解困难论证、检查参考文献、探索例子、编写代码以及形式化证明。

SAIR开放模型计划如何保护数据隐私和社区治理?

数学社区拥有数据并决定其使用方式。只有在用户明确同意并事先商定条款的情况下,才会使用用户数据训练或改进模型。治理由数学社区主导,规则和决策公开,成员可以提出变更、参与决策并问责领导者。

SAIR开放模型计划的开源许可和合作方式是什么?

模型权重和代码将以开放许可发布,例如Apache 2.0、MIT或CC BY 4.0。训练方法公开,评估可复现。欢迎各方以资金、算力、专业知识或社区建设参与,合作需保持研究独立性。

SAIR开放模型计划对模型发布有何透明度要求?

模型发布将报告失败和局限性以及成功之处。独立团队能够复现工作并根据自身数学需求调整模型。训练数据有文档化来源和兼容许可,共享限制明确说明。

🏷️

标签

➡️

继续阅读