SimpleDesign是一种多模态蛋白质设计模型,无需多阶段训练,直接在数据空间端到端训练,结合序列交叉熵与结构回归目标,采用Transformer多模态骨干,在超200万序列-结构对上训练,在协同设计和无条件生成任务上表现优异。
本文详解DeepSeek-V4模型结构:HCA将128个token压缩为一条目,无需稀疏选择;CSA与HCA交错排布,确保全局信息不丢失;滑窗分支弥补压缩导致近token不可见;Q/KV归一化替代QK-Clip;部分RoPE加输出反旋转消除绝对位置;attention sink解决softmax权重分配缺陷;1M上下文KV cache仅5.3GiB,FLOPs约38G。
本文介绍DeepSeek-V4模型中的压缩稀疏注意力(CSA)机制。KV缓存每4个token压缩为一条,1M上下文仍有26万条目,故用lightning indexer打分选择top-1024块。Indexer源自V3.2的DSA,采用64头128维、ReLU加权和FP4量化,通过KL散度模仿主注意力分布训练。V4将索引对象从token改为压缩块,query共享低秩latent。文章详述了indexer实现细节、一层CSA的完整维度流程及参数统计。
本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维KV向量,采用重叠窗口和逐通道softmax加权,K与V共享单头,配合分组输出投影降低参数。相比前代,V4首次压缩缓存条目数,以支持1M上下文的高效推理。
本文介绍Kimi K3模型结构:采用3:1混合,每四层含一层Gated MLA(无位置编码、满秩sigmoid门),其余为KDA层。MLA低秩压缩KV至576维/token,KDA状态固定约232MB。3:1比例经实验选为质量与吞吐平衡点,1M上下文时KV cache约27.6GB,decode速度约为纯MLA的2.2倍。
本文介绍Kimi K3模型序列维度的chunkwise并行算法:将序列分块,块间递推状态、块内用矩阵乘并行计算。K3将每步log-decay加−5下界,使16-token对角tile也能用BF16矩阵乘,消除FP32逐位置对瓶颈。相比通用DPLR内核,KDA内核因结构简化速度快约一倍。训练和prefill用chunkwise形式,decode用递推形式。
本文介绍Kimi K3模型中KDA(Kimi Delta Attention)的递推形式,从线性注意力、DeltaNet到Gated DeltaNet演进而来。KDA通过逐通道衰减和擦除写入机制更新状态,每头128×128矩阵,不依赖上下文长度。它采用逐头RMSNorm和满秩sigmoid输出门,在合成任务中表现优于基线,并天然具备位置编码能力。
制造业IIoT产生高频传感器数据,传统数据库难以处理。文章指出五大趋势及数据层解决方案,并举例说明TimescaleDB如何优化PostgreSQL,实现存储减少83%、查询提速979倍,解决工业4.0数据挑战。
MIT团队开发了名为PottsMPNN的机器学习框架,用于改进计算蛋白质设计。该框架结合物理原理,能更准确建模序列-能量关系,生成结构可行但序列新颖的蛋白质,避免过度模仿天然序列。研究强调,传统以复现天然序列为成功标准并不最佳,PottsMPNN通过引入成对氨基酸相互作用和进化信息,提升了结构兼容性和突变稳定性预测,为设计新型蛋白质奠定基础。
蚂蚁国际发布自研时序AI预测大模型“鹰序TST”2.0版,在基准测试中取得最优成绩,预测准确率超93%。该模型专为跨境支付外汇风险管理设计,已获巴克莱、花旗等银行应用,并拓展至电商、航空等领域。文章还对比了Chronos-2、TimesFM等模型,强调金融场景需结合领域数据验证,通用榜单优势不等于稳定金融收益。
PostgreSQL导入数据后,因显式指定ID未更新序列,导致后续插入报主键重复。修复需用`setval(pg_get_serial_sequence(...), max(id))`,注意空表用`coalesce`,避免硬编码序列名。身份列可用`RESTART WITH`,批量修复可遍历目录,或改用生成数据避免显式ID。
本文提出Bayesian Ensemble(BE)框架,在现有集成方法上增加轻量级贝叶斯层,动态更新成员选择分布而非固定均匀采样。基于此提出BEB(bandit)和BE-DQN(强化学习),在合成环境、Yahoo!R6B推荐和MiniGrid任务中均优于基线,提升探索效率,论文被ICLR 2026接收。
本文探讨视觉Transformer(ViT)的核心设计:将图像切分为patch作为token,并分析其代价。关键点包括:patch大小与分辨率决定序列长度,影响注意力机制的二次方计算成本;CNN的归纳偏置在小数据上更优,而ViT需大数据;DeiT通过数据增强和蒸馏提升训练效率;Swin通过窗口注意力降低复杂度。文章还讨论了位置编码失效、层级结构及未来高分辨率挑战。
Meta广告推荐系统采用多阶段序列模型架构,将离线用户建模与在线排序解耦,结合密集分词和目标感知注意力,实现LLM式可预测扩展。该方案提升Instagram转化率6%、Facebook转化率3%和广告点击率3.5%,并作为GEM核心组件,支持模型规模高效扩展。
MiniCPM推出具身智能模型系列,包括15亿参数的机器人操作模型和0.9B参数的目标跟踪模型,实现端到端映射与实时跟踪。HyperAI官网更新了9个数据集、8个教程等资源,涵盖数学推理、视觉推理等领域,并精选社区文章和百科词条。
RoboTTT将机器人基础模型的视觉-运动上下文扩展至8K时间步,通过测试时训练更新快速权重,在不增加推理延迟下提升性能。相比单步基线,任务性能提高87%,能完成五分钟十阶段装配任务,并支持一次性模仿和即时策略改进,表明上下文长度是机器人模型的新扩展维度。
本文讨论了Gilbreath猜想及其相关序列的研究进展,展示了Gilbreath数组的期望序列及数值模拟结果。尽管序列的渐近行为尚不明了,但研究表明其与Lucas定理、Kummer定理和Sierpinski三角形有关。作者希望获得更多关于渐近概率模型的建议。
PostgreSQL 19引入了序列同步功能,解决了逻辑复制中序列状态未复制的问题。用户可以通过pg_createsubscriber和pg_upgrade工具实现几乎零停机的升级,确保序列值与数据一致,避免重复键值。用户需在重定向写入前执行ALTER SUBSCRIPTION ... REFRESH SEQUENCES,以确保序列安全同步。这一改进显著提升了在线升级的可靠性。
在使用旧版SSH客户端登录Ubuntu 26时,终端可能会显示OSC控制序列信息。解决方法包括升级客户端或禁用OSC序列。可以通过修改.bashrc或全局配置文件来实现,避免影响XWindow终端。如果不想更改pam_systemd.so,可以临时将TERM设置为dumb以消除OSC序列,但这会影响某些工具。
sktime是一个专为时间序列数据设计的Python库,提供类似scikit-learn的API。本文通过工业HVAC传感器的温度预测示例,介绍了时间序列数据的处理,包括数据预处理、模型拟合和评估。sktime支持缺失值填补、去趋势和去季节性等操作,并与Python机器学习生态系统良好集成。
完成下面两步后,将自动完成登录并继续当前操作。