小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Sakana AI推出Doc-to-LoRa和Text-to-LoRa:能够即时理解长上下文并通过零样本自然语言调整LLM的超网络

Sakana AI 提出了两种方法:Text-to-LoRA (T2L) 和 Doc-to-LoRA (D2L),通过轻量级超网络实现大型语言模型的高效定制,显著降低内存和延迟,并支持零样本任务适应和跨模态知识迁移。

Sakana AI推出Doc-to-LoRa和Text-to-LoRa:能够即时理解长上下文并通过零样本自然语言调整LLM的超网络

实时互动网 实时互动网 · 2026-02-28T02:57:08Z

小米开源了全球首个自驾与具身智能统一模型MiMo-Embodied,成功解决了知识迁移难题。该模型通过高质量数据集和四阶段训练策略,打破了室内与户外操作的领域鸿沟,在29个基准测试中表现优异,展现了强大的跨领域能力。

小米打通智驾和具身大模型,然后开源了

量子位 量子位 · 2025-11-26T05:26:46Z

常博士提出了“预测大模型”概念,旨在通过统一学习海量数据,克服特定场景AI模型的局限性。该模型能够迁移至新场景,解决数据稀缺问题,实现高效应用。未来,AGI将具备灵活的知识迁移能力,推动智能进化。

预测大模型工业生存法则,华为博士告诉你什么是B端最需要的大模型

量子位 量子位 · 2025-06-24T07:25:32Z

清华大学、人民大学与字节跳动团队提出了跨分子种类的生成框架UniMoMo,通过统一表示分子片段展示了其在药物设计中的潜力。该框架在多类分子任务中表现优异,验证了跨模态知识迁移的有效性。

入选ICML 2025,清华/人大/字节提出首个跨分子种类统一生成框架UniMoMo,实现多类型药物分子设计

HyperAI超神经 HyperAI超神经 · 2025-05-28T05:41:31Z

本研究提出了一种基于最佳运输的图匹配方法(GM-OT),旨在解决从预训练语言模型向声学特征学习转移语言知识时的对齐挑战。该方法通过将语言和声学序列建模为结构化图,提升了知识迁移效率,显著提高了自动语音识别模型的性能。

Cross-modal Knowledge Transfer Learning for Automatic Speech Recognition Based on Optimal Transport Graph Matching

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-19T00:00:00Z

本研究提出了“潘多拉”框架,以解决现有统一结构知识推理方法在知识迁移和大型语言模型对齐方面的不足。通过使用Python的Pandas API构建知识表示,潘多拉在多个基准测试中表现优于现有框架,并能有效与任务特定方法竞争。

Pandora: A Code-Driven Large Language Model Agent for Unified Reasoning Across Diverse Structured Knowledge

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-04-17T00:00:00Z

本研究提出了一种名为DynamicVis的动态视觉感知基础模型,旨在提升遥感图像分析的泛化能力。该模型结合动态区域感知技术,增强了跨任务知识迁移能力,提高了高分辨率遥感图像的处理效率,并在多个任务中展现出良好的灵活性和效率。

DynamicVis: An Efficient and General Visual Foundation Model for Remote Sensing Image Understanding

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-03-20T00:00:00Z

本研究旨在提高无人机系统在大规模城市环境中的导航效率,并实现知识迁移。提出的元课程训练方案和增量自适应强化学习算法显著提升了导航的收敛速度和适应能力,展示了实际应用潜力。

UAS Visual Navigation in Large and Unseen Environments via a Meta Agent

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-03-20T00:00:00Z

本研究提出了一种跨模态知识迁移学习框架(CMKT),有效整合语言知识与语音增强模型,实验结果表明其在多种条件下表现优异。

语言知识迁移学习在语音增强中的应用

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-03-10T00:00:00Z

本研究探讨开放世界持续学习中已知与未知样本的知识迁移问题,提出的HoliTrans框架结合非线性随机投影和分布感知原型,显著提升了增量学习中的模型表现,为开放世界学习提供了有效解决方案。

Exploring Knowledge Transfer between Known and Unknowns in Open-World Continual Learning

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-02-27T00:00:00Z
模型参数作知识通用载体,MergeNet离真正的异构知识迁移更进一步

AIxiv专栏促进了学术交流,报道了2000多篇文章。研究团队提出MergeNet框架,解决了异构模型间的知识迁移问题,显著提升了跨结构、跨模态和跨任务的迁移效果。

模型参数作知识通用载体,MergeNet离真正的异构知识迁移更进一步

机器之心 机器之心 · 2025-01-28T05:08:15Z
好了,现在你的知识也是我的了.jpg

本文分享了作者对知识吸收的经验,强调心态和知识迁移的重要性。作者总结了知识消化的四个步骤:验证、平行迁移、增强和启发,鼓励读者以开放心态吸收外部知识,成为知识的搬运者。

好了,现在你的知识也是我的了.jpg

Manjusaka Manjusaka · 2024-12-06T18:00:00Z

本研究提出了MM-Eval评估数据集,评估大型语言模型在低资源语言(如蒙古语)中的表现。结果表明,模型在句法任务上优于语义任务,知识任务表现适度下降,显示出模型能够将高资源知识迁移至低资源环境。该数据集为低资源语言的自然语言处理提供了重要支持。

MM-Eval:现代蒙古语评估的层次基准

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-11-14T00:00:00Z

微软推出IGOR方法,通过图像目标表示让机器人模仿人类动作。IGOR利用互联网视频数据,创建统一动作表示空间,实现跨任务知识迁移。其框架包括潜在动作模型、策略模型和世界模型,能在不同任务中应用。

机器人轻松模仿人类,还能泛化到不同任务和智能体!微软新研究,学习人类和机器人统一动作表示

量子位 量子位 · 2024-10-22T06:56:52Z

该研究提出了多种基于深度学习的跨模态知识迁移和图像配准方法,包括无监督深度视觉几何估计、交叉模态匹配模型的噪声鲁棒性提升,以及新型无监督跨模态单应性估计框架SCPNet,展示了在不同模态下的有效性和性能提升。

InterNet:基于交错模态转移和自我监督单应性预测的无监督跨模态单应性估计

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-09-26T00:00:00Z

该研究提出了一种神经符号强化学习架构,旨在克服深度学习的局限性,如对数据的高需求和缺乏透明性。通过简单游戏实验验证了该架构在学习和性能提升方面的有效性,并探讨了内在动机、任务表示方法及知识迁移等问题,提出了多种新模型和框架,以提高深度强化学习的效率和适应性。

自主系统的进化符号表示合成

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-09-18T00:00:00Z

本文探讨了自动连续学习(ACL)方法,利用自指神经网络解决传统神经网络的上下文灾难性遗忘问题。提出的CTR模型和CLARE预训练模型在知识迁移和遗忘方面表现优异,实验结果显示其在多个基准测试中效果显著。此外,TAALM和TriRE等新方法通过动态预测和多机制利用,进一步提高了学习效率并减少了遗忘。

使用注意力学习而不遗忘的学习

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-08-06T00:00:00Z

本文比较了四种视觉基础模型,发现DINO V2在语义分割任务中表现优越,强调了稳健特征提取器的重要性,并探讨了知识迁移和隐私保护方法在医学影像分析中的应用潜力。

以 ImageNet 水平成本访问视觉基础模型

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-07-15T00:00:00Z

本文探讨了动态多目标优化中的连续学习方法,提出了弹性多梯度下降(EMGD)和小型持续学习者合作模型(CoSCL),以提升模型的泛化能力和记忆稳定性。同时,研究了数据集偏差对知识迁移的影响,并提出了TF-CL和SparCL等新框架和算法,以优化学习效率和性能。

Stable Training Methods for Parallel Continual Learning

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-07-11T00:00:00Z

本文介绍了一种新型神经网络架构ModuleFormer,基于稀疏专家混合(SMoE),旨在提高大型预训练语言模型的效率和专业化能力。通过自适应计算模块(ACM)降低计算成本,并提出混合注意力头(MoA)结构,提升自然语言处理任务性能。此外,研究了多路径结构对Transformer模型的影响,提出模块到模块的知识迁移方法(m2mKD),并在多语言机器翻译中应用语言特定矩阵合成(LMS)方法,取得显著改进。

模块混合:将 Transformer 重新定义为动态组件

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-07-09T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码