AVer推出NC30,一款灵活的NDI编码解码器,支持HDMI、USB-C和NDI视频源转换,连接传统音视频系统与IP网络。它简化会议室、教室等混合环境的部署,优化BYOD工作流,无需额外硬件即可访问专业音视频资源,兼容现有AVer设备,提升协作效率。
该文探讨视频编码器专利权利要求是否应视为标准必要专利(SEP)。作者主张不应一概排除编码器权利要求,而应区分涉及标准定义比特流元素的“语法声明”与涉及非标准化编码效率改进的“优化声明”。前者可认定为SEP,后者则不应。文章强调必要性取决于技术联系而非权利要求起草角度,并呼吁采用差异化方法以平衡专利池和FRAND许可。
全球视频编码器市场预计到2025年将达到27.3亿美元,2035年增至44亿美元,年均增长率为4.90%。主要推动因素包括5G和流媒体基础设施的快速部署,以及直播制作向云架构的迁移。AI和新一代编解码器的应用将进一步推动市场发展,降低成本并提升视频质量。
FFmpeg 项目在今年五月为 APV 视频格式引入了 Vulkan 加速解码和编码。开发者 Lynne 发布了首个 Vulkan APV 编码器“apv_encode_vulkan”,并已合并到 FFmpeg Git 代码库中。APV 是一种开源视频编解码器,支持高保真视频制作,并兼容 Google Android 16 及以上版本。
多维科技推出高性能TMR3111D磁编码器芯片,适用于机器人和工业运动控制。该芯片结合高灵敏度TMR技术与数字信号处理,实现高速、高精度的非接触式位置检测,支持多种输出接口,适合伺服系统和人形机器人等高动态应用。
文章讨论了OLAP系统中的压缩技术,重点介绍了列存储的压缩方法。通过使用RLE、字典编码、位打包和增量编码等四种压缩编解码器,数据可以减少5-10倍。每种编码器根据数据类型自动选择,以实现最佳压缩效果,并介绍了压缩的实现细节和未来的开发计划。
赛事直播的低延迟实现依赖于编码器配置、推流协议和播放器缓冲。推荐使用H.264编码,GOP设置为1-2秒,推流协议选择SRT或WebRTC,以降低延迟至1秒以内。同时,优化链路减少转发节点,合理设置播放器缓冲,以确保观众体验流畅。
Miri Technologies Inc. 发布了 V410 4K 实时视频编码器/解码器,支持 60 帧每秒的 4K 输出,具备 HDMI、3G-SDI 和 USB 接口,操作简便,适合各类用户。它支持多种编码解码格式和协议,具备内置 Wi-Fi 7 和双千兆以太网接口,现已发售。
这篇文章介绍了Transformer模型的结构和关键概念。Transformer通过注意力机制替代RNN,解决了序列建模中的上下文依赖问题。引入位置编码使模型能够感知token的位置信息,注意力机制包括自注意力和交叉注意力。编码器和解码器结构相似,但解码器使用因果掩码以确保生成序列的自回归特性。整体上,Transformer实现了高效的并行计算和长距离依赖处理。
Google DeepMind 发布了 Gemma 4 12B,这是一个无编码器的多模态模型,支持文本、图像、音频和视频处理。该模型在消费级笔记本电脑上运行,性能接近 26B MoE 模型,但内存占用不到一半。它通过直接输入视觉和音频数据,简化了处理流程,提升了整体质量和指令遵循性。
谷歌最新的Gemma 4 12B是一款轻量级多模态AI模型,采用无编码器架构,能够直接处理图像和音频,提升了效率和理解能力。其120亿参数使其在普通电脑上运行成为可能,具备高效、快速的响应能力,并支持本地运行,确保隐私和安全。Gemma 4 12B适合个人用户和开发者,具有极高的可定制性。
向量搜索并不等于找到正确答案。现代搜索系统结合双编码器和交叉编码器,前者用于快速召回候选文档,后者用于精确排序。有效的搜索系统需兼顾速度与准确性,以提升搜索质量。
本文介绍了Seq2Seq模型及其点积注意力机制。Seq2Seq用于机器翻译,通过编码器将输入序列转换为上下文表示,解码器生成输出序列。点积注意力计算输入矩阵的相似度,帮助解码器关注输入序列中的重要部分,从而提高上下文捕捉能力,增强翻译效果。
本文探讨了一种学习型图像压缩编码器的设计,旨在优化人类视觉系统的感知质量与运行速度。研究表明,该编码器在压缩性能上显著优于传统编码器,提供2.3-3倍的比特率节省,且在iPhone 17 Pro Max上的编码速度为230毫秒,解码速度为150毫秒,超越大多数基于机器学习的编码器。
本文探讨了人形机器人在“行走-操作”任务中的挑战,提出了一种集成式全身操控系统,结合强化学习、VR遥操作和触觉感知。研究者开发了具身触觉梦境的Transformer(HTD),通过多模态学习提升机器人对接触状态的理解和反应能力,简化了学习过程,旨在提高人形机器人的操作能力和灵活性。
AI-Media在2026年NAB展会上推出新的LEXI文本和语音编码器,这是公司十多年来首次发布新硬件。该编码器支持4K信号传输,兼容多种工作流程,并利用AI技术提升翻译和音频处理能力。此外,AI-Media还推出硬件即订阅模式,降低用户前期投资。
本文总结了Transformer架构的关键组成部分及其工作流程,重点讲解了编码器和解码器的层次结构、自注意力机制、残差连接和位置编码的重要性。探讨了训练与推理的不同方式,以及三种变体(Encoder-only、Decoder-only、Encoder-Decoder)的应用场景和优缺点。最终指出,Decoder-only模型因其灵活性和效率在现代大语言模型中占主导地位。
极海推出基于G32R430编码器MCU的多种绝对值编码器方案,适用于工业自动化和人形机器人。该方案具有低延迟、高精度和多协议兼容性,提升设备续航和运动性能。
开源视频转码器HandBrake发布1.11.0版本,新增DNxHR和ProRes编码器,支持最高4K分辨率的MOV输出,增加AMD VCN AV1编码器,扩展FFV1保存预设,并改进Linux版本的文件处理和用户界面设置。
商汤科技与南洋理工大学推出NEO-unify,重构多模态模型,去除视觉编码器和变分自编码器,实现统一的端到端架构。该模型通过混合变换器架构,提升视觉与语言的理解与生成能力,标志着多模态AI向统一智能体的进化。
完成下面两步后,将自动完成登录并继续当前操作。