小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
转录隔离新机制:揭示基因转录如何不混乱

日本团队利用超分辨显微镜发现,活跃基因所在的真染色质并非教科书描述的松散开放状态,而是压缩成直径约200纳米的团块。粘合素不维持这种压缩,而是隔离团块;缺失粘合素后压缩仍存在,但核小体乱窜、基因串门、共爆发增加。压缩由静电驱动,隔离依赖粘合素,颠覆了“压缩即沉默”的传统模型。

转录隔离新机制:揭示基因转录如何不混乱

极道 极道 · 2026-09-10T12:41:00Z
Meta刚刚在实时转录领域击败了OpenAI和Google

Meta推出实时语音识别模型Muse Voice Transcribe,支持70多种语言、区分20多位说话者及长对话,在基准测试中词错误率3.1%,优于竞品。模型采用自适应延迟机制,通过强化学习平衡准确性与速度。API定价每小时0.18美元,但不开放权重。Meta因眼镜和Mac应用等产品需求,持续推动该技术发展。

Meta刚刚在实时转录领域击败了OpenAI和Google

The New Stack The New Stack · 2026-09-01T17:06:57Z

Speakr是一款免费开源的自我托管转录平台,支持本地或云端后端(如WhisperX、OpenAI),提供高隐私、无月度限制的音频转文字服务。它通过Docker部署,具备AI摘要、说话人识别、语义搜索、协作共享及自动化工作流功能。适合处理敏感数据的专业人士,但需注意API费用或GPU硬件要求。

使用Speakr免费转录

KDnuggets KDnuggets · 2026-09-01T14:00:47Z

谷歌发布Gemini 3.5 Transcribe语音转文字模型,支持实时流式与预录音频处理,词错率低至2.6%,覆盖85种语言,可识别自定义词汇、多说话人及自动清理语气词。该模型已集成至Gemini应用、Android及开发者API,并获合作伙伴好评。

Gemini 3.5 Transcribe 智能转录

Google DeepMind Blog Google DeepMind Blog · 2026-08-26T17:01:00Z
谷歌新AI转录功能可去除你的‘嗯’和‘啊’

谷歌更新Gemini音频模型,推出3.5 Transcribe等新功能,可自动识别专业术语和85种以上语言,去除填充词,支持语音编辑和最多三人说话人识别。3.5 Live增强中断处理和实时视觉处理,实验版可逐步叙述推理过程。更新今日起面向macOS应用和部分Android用户推出。

谷歌新AI转录功能可去除你的‘嗯’和‘啊’

The Verge The Verge · 2026-08-26T17:00:00Z

Google发布Gemini 3.5 Transcribe语音转文字模型,具备高精度、低延迟、多语言支持及智能转录功能,可处理噪音、专业术语并自动清理口语。该模型已集成至Gemini API、Google AI Studio等平台,并应用于Android、macOS等产品,支持实时流式与预录音频处理,显著提升转录效率。

使用Gemini 3.5 Transcribe进行智能转录

The Keyword The Keyword · 2026-08-26T17:00:00Z
S1-mini:Superwhisper 发布 462MB 开源权重文本规范化模型,将原始 ASR 转录转为整洁书面文本

Superwhisper发布S1系列,其中S1-mini为开源0.6B文本规范化模型,基于Qwen3微调,将ASR转录转为整洁文本,支持风格、结构、上下文三轴控制。Q4量化仅462MB,可本地部署。需关闭思考模式并贪心解码,测试token准确率94.8%。云端S1-Voice和S1-Language提供转录与格式化服务。

S1-mini:Superwhisper 发布 462MB 开源权重文本规范化模型,将原始 ASR 转录转为整洁书面文本

实时互动网 实时互动网 · 2026-08-21T02:50:45Z
超越转录:对话式语音识别 (CSR) 如何教会 AI 真正倾听

对话式语音识别(CSR)正取代传统自动语音识别,通过理解对话的实时展开、轮流发言和时机,实现低延迟响应。它支持多语言切换,已在客服、医疗、金融等领域应用,推动人机交互更自然、更人性化,成为下一代语音AI的基础。

超越转录:对话式语音识别 (CSR) 如何教会 AI 真正倾听

实时互动网 实时互动网 · 2026-08-04T02:28:15Z
AI Gateway 现已支持流式转录

AI Gateway新增流式转录功能,支持边捕获音频边输出实时转录结果,降低延迟,适用于实时字幕和语音输入。该功能处于测试阶段,可通过AI SDK的streamTranscribe函数使用,兼容多种模型如OpenAI和xAI,并支持为智能体添加语音模式,无需改动现有文本处理流程。

AI Gateway 现已支持流式转录

Vercel News Vercel News · 2026-07-22T00:00:00Z
AI Gateway 现已支持实时语音、语音生成和音频转录

AI Gateway现已支持语音和音频模型,用户可以实时构建语音代理、将文本转换为语音以及进行音频转录。这些功能在测试阶段,提供与文本、图像和视频模型相同的可观察性和费用控制,用户可通过AI SDK 7实现低延迟的实时对话。

AI Gateway 现已支持实时语音、语音生成和音频转录

Vercel News Vercel News · 2026-06-29T00:00:00Z
转录组时钟:精准预测生理年龄与死亡风险的新工具

科学家分析超过11000份转录组数据,开发出一种“转录组时钟”,能够精准预测生理年龄和死亡风险。该工具将老化分解为多个功能模块,揭示不同干预措施(如药物、节食、疾病)对老化的影响,并在细胞和胚胎层面验证了“返老还童”的可能性,为抗衰老研究提供了新框架。

转录组时钟:精准预测生理年龄与死亡风险的新工具

极道 极道 · 2026-06-16T00:44:00Z

越来越多的内容创作者转向音视频表达,转录成为信息消费者的日常。推荐使用TranscribeX,因为它支持多种转录模型和视频下载功能。Gemini系列模型适合整理转录内容,能够直接处理音频和视频。对于线上会议,whisper.cpp命令行工具在Apple Silicon上高效运行,适合转录需求。

装了啥:编辑部用什么转写音视频内容?

少数派 少数派 · 2026-05-15T09:56:34Z
OpenAI 在 Realtime API 中发布了三个实时音频模型:GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper

OpenAI 发布了三个新音频模型:GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper,分别用于语音推理、实时翻译和转录。GPT-Realtime-2 具备 GPT-5 级推理能力,支持复杂对话和任务;GPT-Realtime-Translate 可将 70 多种语言实时翻译成 13 种语言;GPT-Realtime-Whisper 提供低延迟的语音转文本服务。所有模型已通过 Realtime API 正式上线。

OpenAI 在 Realtime API 中发布了三个实时音频模型:GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper

实时互动网 实时互动网 · 2026-05-09T03:14:53Z

本文介绍了如何使用Faster-Whisper在本地快速转录音频。首先需将音频转换为16 kHz单声道WAV格式,然后使用Python脚本进行转录。Faster-Whisper比原版Whisper速度更快,适合在CPU和GPU上运行,保护隐私且无需云服务。设置环境时需安装FFmpeg和pydub库,并提供了完整的转录示例代码。

本地Whisper音频转录

KDnuggets KDnuggets · 2026-04-28T14:00:53Z
绿原酸和牛磺酸如何联手对抗皮肤衰老?转录组测序给出新答案

研究发现,绿原酸与牛磺酸联合处理皮肤细胞能显著调控62个衰老相关基因,关键转录因子TGFB2、ETS1和EGR1在抗衰老中发挥重要作用。联合处理效果优于单独使用,可能通过改善细胞氧气利用来对抗衰老。尽管存在体外实验和样本量小的局限性,但为天然成分的抗衰老机制提供了新思路。

绿原酸和牛磺酸如何联手对抗皮肤衰老?转录组测序给出新答案

极道 极道 · 2026-04-18T12:12:00Z
一千块的录音卡片,凭什么还敢每年多收一千块钱?

Plaud是一款专注于录音的AI硬件,配合App提供高效的转录和分析服务。用户可选择不同的订阅方案,获得专业模板和功能,提升录音信息处理效率。Plaud通过简化用户体验,使用户无需深入了解AI技术即可获得高质量结果,体现了AI产品的便捷性和确定性。

一千块的录音卡片,凭什么还敢每年多收一千块钱?

爱范儿 爱范儿 · 2026-04-15T02:41:40Z
英特尔发布 OpenVINO 2026,改进了 NPU 处理能力,并扩展了对 LLM 的支持

英特尔发布了 OpenVINO 2026.0,增强了对大型语言模型的支持,改进了酷睿 Ultra NPU 的兼容性,新增多种模型执行支持,并提升转录和字幕功能的准确性。同时,该版本优化了内存需求和性能,支持提前编译,以加速集成和价值实现。

英特尔发布 OpenVINO 2026,改进了 NPU 处理能力,并扩展了对 LLM 的支持

实时互动网 实时互动网 · 2026-02-24T01:53:34Z
离线音频转录翻译,实时麦克风与文件处理 | 开源日报 No.858

mini-sglang 是高性能语言模型推理框架,简化 LLM 服务;pg-aiguide 优化 PostgreSQL 代码生成,支持版本感知搜索;buzz 是离线音频转录工具,支持多种格式和实时转录;ansible-collection-hardening 提供 Linux 安全加固配置;feishu-doc-helper 用于飞书文档批量导出。

离线音频转录翻译,实时麦克风与文件处理 | 开源日报 No.858

开源服务指南 开源服务指南 · 2026-01-22T07:36:00Z
NVIDIA AI 发布 Nemotron Speech ASR:全新的开源实时转录模型

NVIDIA发布了Nemotron语音识别模型,专为低延迟语音助手和实时字幕设计。该模型采用缓存感知的FastConformer编码器和RNNT解码器,支持16 kHz音频,提供多种输入块配置,词错误率在7.2%至7.8%之间,显著提升了并发性和稳定性,适用于实时语音应用。

NVIDIA AI 发布 Nemotron Speech ASR:全新的开源实时转录模型

实时互动网 实时互动网 · 2026-01-08T02:51:11Z
Plaud更新了NotePin,增加了一个按钮

Plaud更新了NotePin AI录音器,推出新款NotePin S,增加了简化录音操作的按钮。新设备与原版相似,售价179美元,支持音频录制和转录,并配有Plaud Desktop应用,用户可免费使用。

Plaud更新了NotePin,增加了一个按钮

The Verge The Verge · 2026-01-04T17:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码