日本团队利用超分辨显微镜发现,活跃基因所在的真染色质并非教科书描述的松散开放状态,而是压缩成直径约200纳米的团块。粘合素不维持这种压缩,而是隔离团块;缺失粘合素后压缩仍存在,但核小体乱窜、基因串门、共爆发增加。压缩由静电驱动,隔离依赖粘合素,颠覆了“压缩即沉默”的传统模型。
Meta推出实时语音识别模型Muse Voice Transcribe,支持70多种语言、区分20多位说话者及长对话,在基准测试中词错误率3.1%,优于竞品。模型采用自适应延迟机制,通过强化学习平衡准确性与速度。API定价每小时0.18美元,但不开放权重。Meta因眼镜和Mac应用等产品需求,持续推动该技术发展。
Speakr是一款免费开源的自我托管转录平台,支持本地或云端后端(如WhisperX、OpenAI),提供高隐私、无月度限制的音频转文字服务。它通过Docker部署,具备AI摘要、说话人识别、语义搜索、协作共享及自动化工作流功能。适合处理敏感数据的专业人士,但需注意API费用或GPU硬件要求。
谷歌发布Gemini 3.5 Transcribe语音转文字模型,支持实时流式与预录音频处理,词错率低至2.6%,覆盖85种语言,可识别自定义词汇、多说话人及自动清理语气词。该模型已集成至Gemini应用、Android及开发者API,并获合作伙伴好评。
谷歌更新Gemini音频模型,推出3.5 Transcribe等新功能,可自动识别专业术语和85种以上语言,去除填充词,支持语音编辑和最多三人说话人识别。3.5 Live增强中断处理和实时视觉处理,实验版可逐步叙述推理过程。更新今日起面向macOS应用和部分Android用户推出。
Google发布Gemini 3.5 Transcribe语音转文字模型,具备高精度、低延迟、多语言支持及智能转录功能,可处理噪音、专业术语并自动清理口语。该模型已集成至Gemini API、Google AI Studio等平台,并应用于Android、macOS等产品,支持实时流式与预录音频处理,显著提升转录效率。
Superwhisper发布S1系列,其中S1-mini为开源0.6B文本规范化模型,基于Qwen3微调,将ASR转录转为整洁文本,支持风格、结构、上下文三轴控制。Q4量化仅462MB,可本地部署。需关闭思考模式并贪心解码,测试token准确率94.8%。云端S1-Voice和S1-Language提供转录与格式化服务。
对话式语音识别(CSR)正取代传统自动语音识别,通过理解对话的实时展开、轮流发言和时机,实现低延迟响应。它支持多语言切换,已在客服、医疗、金融等领域应用,推动人机交互更自然、更人性化,成为下一代语音AI的基础。
AI Gateway新增流式转录功能,支持边捕获音频边输出实时转录结果,降低延迟,适用于实时字幕和语音输入。该功能处于测试阶段,可通过AI SDK的streamTranscribe函数使用,兼容多种模型如OpenAI和xAI,并支持为智能体添加语音模式,无需改动现有文本处理流程。
AI Gateway现已支持语音和音频模型,用户可以实时构建语音代理、将文本转换为语音以及进行音频转录。这些功能在测试阶段,提供与文本、图像和视频模型相同的可观察性和费用控制,用户可通过AI SDK 7实现低延迟的实时对话。
科学家分析超过11000份转录组数据,开发出一种“转录组时钟”,能够精准预测生理年龄和死亡风险。该工具将老化分解为多个功能模块,揭示不同干预措施(如药物、节食、疾病)对老化的影响,并在细胞和胚胎层面验证了“返老还童”的可能性,为抗衰老研究提供了新框架。
越来越多的内容创作者转向音视频表达,转录成为信息消费者的日常。推荐使用TranscribeX,因为它支持多种转录模型和视频下载功能。Gemini系列模型适合整理转录内容,能够直接处理音频和视频。对于线上会议,whisper.cpp命令行工具在Apple Silicon上高效运行,适合转录需求。
OpenAI 发布了三个新音频模型:GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper,分别用于语音推理、实时翻译和转录。GPT-Realtime-2 具备 GPT-5 级推理能力,支持复杂对话和任务;GPT-Realtime-Translate 可将 70 多种语言实时翻译成 13 种语言;GPT-Realtime-Whisper 提供低延迟的语音转文本服务。所有模型已通过 Realtime API 正式上线。
本文介绍了如何使用Faster-Whisper在本地快速转录音频。首先需将音频转换为16 kHz单声道WAV格式,然后使用Python脚本进行转录。Faster-Whisper比原版Whisper速度更快,适合在CPU和GPU上运行,保护隐私且无需云服务。设置环境时需安装FFmpeg和pydub库,并提供了完整的转录示例代码。
研究发现,绿原酸与牛磺酸联合处理皮肤细胞能显著调控62个衰老相关基因,关键转录因子TGFB2、ETS1和EGR1在抗衰老中发挥重要作用。联合处理效果优于单独使用,可能通过改善细胞氧气利用来对抗衰老。尽管存在体外实验和样本量小的局限性,但为天然成分的抗衰老机制提供了新思路。
Plaud是一款专注于录音的AI硬件,配合App提供高效的转录和分析服务。用户可选择不同的订阅方案,获得专业模板和功能,提升录音信息处理效率。Plaud通过简化用户体验,使用户无需深入了解AI技术即可获得高质量结果,体现了AI产品的便捷性和确定性。
英特尔发布了 OpenVINO 2026.0,增强了对大型语言模型的支持,改进了酷睿 Ultra NPU 的兼容性,新增多种模型执行支持,并提升转录和字幕功能的准确性。同时,该版本优化了内存需求和性能,支持提前编译,以加速集成和价值实现。
mini-sglang 是高性能语言模型推理框架,简化 LLM 服务;pg-aiguide 优化 PostgreSQL 代码生成,支持版本感知搜索;buzz 是离线音频转录工具,支持多种格式和实时转录;ansible-collection-hardening 提供 Linux 安全加固配置;feishu-doc-helper 用于飞书文档批量导出。
NVIDIA发布了Nemotron语音识别模型,专为低延迟语音助手和实时字幕设计。该模型采用缓存感知的FastConformer编码器和RNNT解码器,支持16 kHz音频,提供多种输入块配置,词错误率在7.2%至7.8%之间,显著提升了并发性和稳定性,适用于实时语音应用。
Plaud更新了NotePin AI录音器,推出新款NotePin S,增加了简化录音操作的按钮。新设备与原版相似,售价179美元,支持音频录制和转录,并配有Plaud Desktop应用,用户可免费使用。
完成下面两步后,将自动完成登录并继续当前操作。