共生知行发布双足人形机器人驾驶卡丁车Demo,作为全身智能压力测试,验证视觉感知、平衡、手眼脚协同等能力。公司定位为全身智能基座模型公司,探索端到端技术路线,核心团队来自智源、港科大等,具备VLA和运动控制积累。未来将发布更多技术报告和案例,推动人形机器人从“能运动”到“能完成任务”。
Krafton开源语音AI模型A.X K2 Raon-Speech,采用端到端语音直接转换,保留情感语调,21B参数,韩语综合第一、英语第三,覆盖语音识别、合成等6领域,未来将用于游戏CPC角色实时互动。
OvisOCR2是2026年7月推出的0.8B参数端到端文档解析模型,基于Qwen3.5-0.8B构建,能将文档图像转为结构化Markdown,精准解析文本、公式、表格等。在OmniDocBench v1.6评测中获96.58分,超越传统流水线方法,实现低部署成本与高性能统一。HyperAI官网已上线该模型,并提供在线使用。
本文提出了一种高效的端到端自动语音识别解码方法,针对大语言模型在解码中的计算成本和词汇不匹配问题,采用“延迟融合”策略,减少LLM推理调用次数,从而提升解码速度和准确性。
使用Testcontainers简化Kubernetes应用测试,提供轻量级容器模拟集群及依赖。通过testcontainers-python库,可以进行端到端测试,确保应用在Kubernetes中的行为符合预期。
云原生平台越来越受欢迎,但面临安全挑战。实施端到端安全至关重要,涵盖基础设施、容器、Kubernetes、应用和数据,能够提升安全性、增强合规性、提高业务灵活性并降低成本。
自变量机器人(X Square)是国内唯一采用端到端统一大模型技术的公司,其正在训练的WALL-A模型在多个维度上超越了Physical Intelligence,能够处理复杂任务如拉拉链和折衣服,展现出强大的泛化能力。创始团队认为,端到端和统一模型是解决机器人操作问题的关键,未来有望推动机器人技术的重大突破。
理想汽车发布第三代自动驾驶技术架构,采用端到端+视觉语言模型+世界模型的方法,提高AI的信息处理效率和对复杂路况的应对能力。该架构受到诺贝尔奖得主丹尼尔·卡尼曼的快慢系统理论启发,模拟人类的思考和决策过程。理想汽车已全面切入端到端+大模型方案,让车辆能够理解复杂路况和交通规则。他们利用用户数据进行训练和验证,提高系统的能力上限和迭代速度。下半年实现端到端+视觉语言模型的自动驾驶量产交付是他们的下一个目标。
本文提出了一种基于LSTM网络的端到端视觉语音识别系统,取得了最先进的分类性能。在OuluVS2数据库上比基准提高了9.7%,在CUAVE数据库上比其他类似方法的系统提高了1.5%。
本文介绍了一种新的端到端语音情感识别系统,利用共同关注机制和多层声学信息。实验证明该系统在IEMOCAP数据集上表现出竞争性能。
本文介绍了一种基于约束编程和强化学习的端到端解决调度问题的方法,通过神经网络架构和训练算法,在七个JSSP数据集上展示了比静态PDRs和CP求解器更高质量的解决方案。
本技术报告介绍了LongViT,一种能够以端到端方式处理十亿像素图像的视觉Transformer。通过将图像分割成补丁并进行线性投影,使用LongNet对极长序列进行建模,生成捕捉了短程和长程依赖关系的表示。实验结果表明,LongViT在癌症诊断和预后方面优于先前的方法。
该研究提出了一种端到端的定向目标检测器,结合了旋转RoI注意力和选择性不同查询技术,能够有效解决遥感图像中多方向、不同尺度、密集分布的目标实例的检测问题。通过交叉注意机制,能够聚焦定向感兴趣区域并对多尺度特征进行对齐。实验证明该方法在多个数据集上取得了最先进的性能。
该研究探讨了经过语料库特殊增强后的端到端语音到文本翻译,研究了没有源语言转录和仅提供源语言转录的情况。实验结果表明,可以训练出紧凑高效的模型,并提供语料库,希望未来的研究能够挑战该语音翻译基线模型。
该文章介绍了一种基于手绘草图的3D建模方法,采用端到端的方式,引入了轻量级生成网络和结构感知对抗训练,并通过Stroke Enhancement Module(SEM)捕捉结构信息,提升性能。实验证明该方法在合成和真实数据集上具有最先进的性能。
微软的DelightfulTTS是一种端到端神经文本语音合成系统,用于Blizzard Challenge 2021。该系统通过直接建模和生成48 kHz采样率的波形,以及系统化设计来建模语音中的变化信息,实现了自然且高质量的语音合成。
该研究介绍了METER框架,一种多模态端到端Transformer框架,通过设计和预训练基于Transformer的视听模型,取得了77.64%的准确率,超过了以前的最优模型,最佳情况下可达到80.54%的准确率。
完成下面两步后,将自动完成登录并继续当前操作。