小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
刚刚!Ilya首个模型曝光了

SSI正探索基于TTT的小型推理引擎,模型通过专门数据学习“如何学习”,并在推理中更新权重,规模虽小但性能强大。爆料称当前版本8月可能发布,下一代规模将扩大10倍。Ilya此前强调持续学习,英伟达投资SSI并提升算力,TTT路线或成其秘密武器,但真实性待确认。

刚刚!Ilya首个模型曝光了

量子位 量子位 · 2026-08-13T08:36:53Z
RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步

RoboTTT将机器人基础模型的视觉-运动上下文扩展至8K时间步,通过测试时训练更新快速权重,在不增加推理延迟下提升性能。相比单步基线,任务性能提高87%,能完成五分钟十阶段装配任务,并支持一次性模仿和即时策略改进,表明上下文长度是机器人模型的新扩展维度。

RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步

结构之法 算法之道 结构之法 算法之道 · 2026-07-21T15:49:12Z

在线性注意力模型中加入短卷积(Short Conv)是为了增强模型的表达能力,弥补线性化带来的性能下降。通过TTT(在线学习)框架,模型能够有效压缩信息,提高学习效果,避免“自我预测”的局限性。

为什么线性注意力要加Short Conv?

科学空间|Scientific Spaces 科学空间|Scientific Spaces · 2025-10-05T08:25:00Z

机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。

TTS和TTT已过时?TTRL横空出世,推理模型摆脱「标注数据」依赖,性能暴涨

机器之心 机器之心 · 2025-04-24T05:09:13Z

本研究提出了Med-TTT模型,解决医学图像分割中卷积神经网络和Transformer的计算复杂度及特征丢失问题。通过视觉-测试时间训练层,该模型以线性复杂度建模长程依赖,自适应调整参数,提高复杂背景下的分割能力,实验结果优异。

Med-TTT: A Vision Test-Time Training Model for Medical Image Segmentation

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-10-03T00:00:00Z

本文介绍了多种测试时间自适应(TTA)模型,旨在提高深度学习在域漂移情况下的分类性能。研究提出了基于测试熵最小化、alpha-BN框架和元学习方法等技术,解决了批量归一化不平衡问题,并在多个数据集上实现了最先进的性能。

Meta-TTT:一种用于测试时训练的元学习最小最大框架

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-10-02T00:00:00Z

本研究探讨了多种医学图像分割模型,如UNet++、TransUNet和Swin-Unet,强调它们在分割精度和速度上的优势。结合Transformer和U-Net架构的模型在多器官和肿瘤分割任务中表现优异。通过迁移学习和优化损失函数,研究为医学成像提供了有效的解决方案和最佳实践。

TTT-Unet:通过测试时间训练层增强U-Net用于生物医学图像分割

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-09-17T00:00:00Z

TTT是一个新的模型,旨在将长上下文压缩为固定大小的隐藏状态。与RNN不同,TTT能够有效地捕捉标记之间的底层结构和关系。TTT使用自监督学习将历史上下文压缩为隐藏状态,以用于预测。该模型通过基于自监督损失更新权重进行训练。TTT在压缩长上下文的同时保持了效率和质量,展现了有希望的结果。

一文通透TTT:让RNN的隐藏层变成可学习的函数——继mamba之后也想超越Transformer

结构之法 算法之道 结构之法 算法之道 · 2024-07-22T13:42:05Z
彻底改变语言模型:全新架构TTT超越Transformer,ML模型代替RNN隐藏状态

一项新的研究提出了名为Test-Time Training(TTT)的新架构,用于替代Transformer模型,并在大型语言模型(LLM)上取得更好的性能。TTT通过使用机器学习模型代替RNN的隐藏状态,并通过实际梯度下降来压缩上下文,设计了新架构。实验结果表明,TTT-Linear和TTT-MLP能够匹敌或击败最强大的Transformer和Mamba架构方法。研究团队公开了代码供人们训练和测试。该研究认为,TTT层可以直接替代Transformer中的自注意力层,并具有更低的困惑度和更好的利用长上下文的能力。

彻底改变语言模型:全新架构TTT超越Transformer,ML模型代替RNN隐藏状态

机器之心 机器之心 · 2024-07-10T03:20:27Z

新架构RNN反超Transformer,将隐藏状态换成可学习的模型,称为TTT。TTT在短上下文时表现超过了Transformer和Mamba,且能更好利用长上下文。隐藏状态模型可以是任意模型,可用于压缩上下文和视频建模。TTT方法还需继续研究和努力。

新架构RNN反超Transformer:每个隐藏状态都是一个模型,一作:从根本上改变语言模型

量子位 量子位 · 2024-07-09T07:03:13Z

本文提出了一种新型无监督测试时训练(TTT)技术,通过最大化多尺度特征图与离散潜在表示之间的相互信息,整合到标准训练中。实验结果表明,该方法在不同测试时适应基准上表现出竞争力的分类性能。

TTT-KD: 基于基础模型的知识蒸馏进行测试时训练用于 3D 语义分割

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-03-18T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码