谷歌浏览器自动下载约4GB的模型权重文件,引发用户关注。该模型用于本地处理功能,如网页摘要和安全检测,用户可选择禁用。但部分用户在设置中找不到禁用选项,导致误解。谷歌建议用户在浏览器设置中禁用AI功能,以避免自动下载。
随着AI在各行业的快速应用,企业在管理和分发大型模型权重文件时面临挑战。现有模型存储方法未能与Kubernetes原生交付结合,导致部署脆弱和安全风险。文章提出了一种云原生解决方案,将模型权重视为OCI工件,利用容器工具链实现高效管理和分发,提升AI模型的生命周期管理。
文章探讨了AI时代开源的变革,指出中美厂商在开源策略上的差异:美国公司倾向于闭源以保持竞争力,而中国厂商则通过开源建立生态。开源的核心已从源码转向模型权重和微调能力,强调赋能开发者。
马斯克创立的AI公司xAI已将Grok 2.5模型权重上传至Hugging Face,并计划在约六个月后开源Grok 3。Grok 2.5是去年的最佳模型,但因社交媒体上的争议,xAI决定对其进行重新训练,以清理训练数据中的“垃圾”。
网络犯罪分子利用名为"ShadowInit"的新型恶意软件,针对AI模型基础设施窃取模型权重并篡改输出,影响欺诈检测和自动驾驶等应用。该恶意软件通过共享训练笔记本入侵,造成直接和长期损失。防御措施包括镜像签名验证和实时模型监控。
本研究提出了一种新策略,通过微调低秩适配器,将水印直接嵌入AI生成文本的模型权重中,以增强透明度和责任感,并优化水印的可检测性。
本研究比较了LoRA与全面微调在模型权重矩阵上的差异,发现LoRA模型存在“入侵维度”,而全面微调则没有。尽管两者在目标任务上表现相似,但LoRA在多任务适应性方面较弱,这对理解微调方法的影响具有重要意义。
研究提出了一种新方法ProbeX,解决了在嵌入模型权重和语言联合空间中训练模型的挑战。ProbeX能在单层中有效映射大模型权重,实现零样本分类和检索。研究还探讨了不同模型在语言知识编码上的差异,提出了基于结构的排序方法,并研究了神经网络权重空间的特性。通过模型树遗传恢复任务,成功重建了复杂模型树结构,为模型作者鉴定和互联网索引提供支持。
介绍了使用Keras中的ModelCheckpoint和EarlyStopping回调函数来保存模型权重和提前停止训练的方法。ModelCheckpoint会在每个训练周期结束时保存模型权重,仅当损失函数有改善时才保存最佳权重。EarlyStopping会在训练过程中,当损失函数不再改善时提前停止训练。
FedClust 是一种聚类联邦学习方法,通过分析局部模型权重与客户数据分布的相关性进行客户分组,能够动态适应新客户。实验结果表明,FedClust 在准确性和通信成本方面优于基线方法。同时,FedAC 框架通过解耦神经网络和不同聚合方法,提高了在非独立同分布环境下的测试准确率。此外,研究还提出了多种新型聚类方法,以解决联邦学习中的数据隐私和性能问题。
介绍了一种多物理预训练方法,通过学习广泛适用的特征来预测多个异质物理系统的动力学。验证了该方法在流体力学基准测试中的有效性,并证明微调训练的模型对新物理现象有更准确的预测能力。代码和模型权重已开源。
提出了一种统一的GNN稀疏化框架,剪枝图邻接矩阵和模型权重,加速大规模图上的GNN推理。通过迭代应用UFS联合鉴定,GLT能在不影响预测性能的前提下实现小和大规模图数据集上的MACS节约。
该论文提出了一种新的水印策略,通过在大型语言模型的量化过程中植入水印来保护模型权重,避免恶意使用违反开源大型语言模型的许可证。该方法已成功应用于GPT-Neo和LLaMA等开源大型语言模型。
本文研究了使用高资源语言预训练的模型权重作为启动来降低获取低资源语言高质量语言模型所需的数据和计算量的方法,并提出了一种嵌入初始化方法FOCUS,该方法在适应XLM-R时优于先前的方法。
该文介绍了一种名为多物理预训练(MPP)的方法,用于物理代理建模。该方法通过学习在不同物理任务中广泛适用的特征,训练大型代理模型来同时预测多个异质物理系统的动力学。该方法在广泛的流体力学基准测试中验证了其有效性,并且无需微调。
我们推出了Jukebox,一个神经网络,能够生成多种风格和艺术家的音乐,包括基础的歌唱。我们将发布模型权重、代码及生成样本的工具。
我们发布了GPT-2的最终版本(15亿参数),包括代码和模型权重,以便检测其输出。尽管已有更大语言模型发布,我们仍按计划提供完整的分阶段发布案例,以支持未来强大模型的开发。
完成下面两步后,将自动完成登录并继续当前操作。