小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
技术漫谈|ASR中的瑞士军刀:方言识别

方言语音识别不仅需听清发音,还需决定如何书写。难点分三层:声音、词汇语法和书写。大模型能提升能力,但需区分忠实转写与方言转普通话两种任务,并处理文本正则化、热词增强和口语顺滑。系统应分层建模,分别评价,以尊重方言原貌并满足不同场景需求。

技术漫谈|ASR中的瑞士军刀:方言识别

实时互动网 实时互动网 · 2026-09-01T07:21:59Z
早报|皮卡丘造访苹果,见到库克、特努斯/微信回应方言采集争议:已清理异常文本/鸿蒙生态设备突破8000万

本文汇总了多领域新闻:微信图片折叠功能被用作穿搭分享;意大利拟对过马路看手机罚款;小米芯片获人民日报好评;电动重卡商业险投保难;G20技术会议将讨论AI监管;发改委警示机器人产业避免盲目跟风;鸿蒙设备突破8000万;多家公司财报发布,如顺丰、比亚迪、美团等;智谱开源GLM-5.3;腾讯开源Hy4模型;Meta测试AI智能体;Apple TV涨价;以及周末娱乐推荐。

早报|皮卡丘造访苹果,见到库克、特努斯/微信回应方言采集争议:已清理异常文本/鸿蒙生态设备突破8000万

爱范儿 爱范儿 · 2026-08-29T00:21:15Z
AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单

阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,支持细粒度标签控制、20种方言和16种语言,覆盖多语种场景。模型分Flash和Plus版本,在权威榜单夺冠,具备高鲁棒性和48kHz高质量输出,适用于实时交互和严肃创作,已开放调用。

AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单

量子位 量子位 · 2026-07-20T09:05:06Z
阿里发布 Fun-ASR-Realtime 实时语音识别模型 ,支持16种方言和30种语言!

阿里通义推出了实时语音识别模型Fun-ASR-Realtime,具备百毫秒首字延迟和高准确率,支持16种方言和30种语言。在“重返荒岛”直播中,该模型提供实时字幕,识别准确率接近离线模型,适用于国际会议和客服等复杂场景。

阿里发布 Fun-ASR-Realtime 实时语音识别模型 ,支持16种方言和30种语言!

实时互动网 实时互动网 · 2026-07-06T08:48:44Z
模型上新:阿里推出 Fun-ASR-Flash,从“听清楚”走向“听明白”

阿里推出的Fun-ASR-Flash语音识别模型支持三十种语言和十六种方言,准确率达到87.8%。该模型通过上下文和热词减少语义歧义,提升了对方言和小语种的识别能力,适用于复杂业务场景。

模型上新:阿里推出 Fun-ASR-Flash,从“听清楚”走向“听明白”

实时互动网 实时互动网 · 2026-06-29T09:34:57Z

本文介绍了 MLIR 中的 IR 结构及其与 LLVM IR 的关键差异。MLIR 通过 Operation 进行遍历,每种操作都是独立类型,增强了类型安全性。文章详细阐述了 Operation、Value、Block 和 Region 的内存布局及其功能,并强调了 MLIR 的类型系统和属性设计。

【编译器工程与 MLIR】操作、方言与 IR 的 C++ 表示

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-09T00:00:00Z

本文讨论了方言转换与渐进降阶策略,介绍了如何将模块从一种方言系统性地转换为另一种方言。方言转换框架是实现渐进降阶的核心,涉及类型转换、合法性规则和转换模式。通过完整转换和部分转换,确保转换后的IR类型一致且语义等价。文章还探讨了常见陷阱及其解决方案,强调了编译流水线中优化与降阶的结合。

【编译器工程与 MLIR】方言转换与渐进降阶策略

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-09T00:00:00Z

本文介绍了MLIR中的张量和线性代数方言,强调它们在AI编译中的重要性。张量方言表示不可变的多维数组,支持创建、读取和修改等核心操作。线性代数方言用于表达结构化数值计算,包含命名操作和通用操作,并支持分块、融合和向量化等优化策略。最终,Linalg操作需降阶为实际循环,以实现高效计算。

【编译器工程与 MLIR】张量中端:Tensor 与 Linalg 方言

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-09T00:00:00Z

MLIR(多层中间表示)是一种具有四层嵌套结构的编译器基础设施,包括Module、Operation、Region和Block。其设计原则包括渐进降阶和方言可组合性,支持逐步优化和不同方言的协作。MLIR的基础设施复用使方言开发者能够专注于核心逻辑,减少样板代码。IREE和CIRCT等实际应用展示了MLIR在AI编译和硬件设计中的优势。

【编译器工程与 MLIR】MLIR 全景图与设计哲学

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-09T00:00:00Z

本文介绍了MLIR中的ODS(操作定义规范)和TableGen的使用。ODS通过声明式语言定义操作的接口和行为,自动生成C++代码,减少手写代码量。TableGen用于生成结构化C++代码,主要描述方言和操作。定义方言需要三层.td文件,包括方言定义、操作定义和类型定义。ODS支持参数、结果描述及声明式打印/解析,提升开发效率。

【编译器工程与 MLIR】表驱动定义:ODS 与声明式编程

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-09T00:00:00Z

MLIR(多级中间表示)改变了编译器基础设施的模式,从“产品”转变为“平台”,允许用户自定义方言和降阶路径。它通过渐进降阶和多方言混合提高了编译器的可观察性和灵活性,但核心语义设计问题仍然存在,调试复杂度转移,且MLIR不能替代LLVM。未来的MLIR 2.0将引入方言版本化和模块化构建等新特性,并探索AI在编译器生成中的应用。

【编译器工程与 MLIR】总结与未来趋势

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-09T00:00:00Z
30万奖金池,这道汉语方言对话题等你来解丨第十一届信也科技杯全球AI算法大赛

第十一届信也科技杯全球AI算法大赛正在进行,奖金池达到30万元,鼓励参与者探讨汉语方言对话题,并提供NLPCC2026直通名额。

30万奖金池,这道汉语方言对话题等你来解丨第十一届信也科技杯全球AI算法大赛

量子位 量子位 · 2026-05-18T05:08:22Z
云知声 U2-ASR 2.5上线:覆盖七大方言体系,支持100种以上方言及地方口音识别转写

云知声推出的U2-ASR 2.5方言语音识别模型支持100种以上方言,识别准确率超过90%。该模型通过优化数据处理、解码和语义理解,将方言转化为规范普通话,广泛应用于政务、医疗和客服等领域。

云知声 U2-ASR 2.5上线:覆盖七大方言体系,支持100种以上方言及地方口音识别转写

实时互动网 实时互动网 · 2026-05-13T03:24:32Z

文章反思中文拼音与方言的流失,感叹语言丰富度下降,并批评现代输入法导致书面语言退化。作者主张回归个体生活,重建内在丰富性,同时提及日常琐事如种菜、腌泡菜,并决定学习芒格的栅格模型,投资简单易懂的企业。

入蜀记 day303 傻子模式

素生 素生 · 2026-03-23T04:48:27Z

豆包语音更新支持粤语、四川话、东北话和陕西话,具备思考能力,能灵活切换方言,提高沟通效率。同时,字节跳动于2025年颁发20万元奖学金,支持优秀博士生的科研与技术创新。

豆包语音对话功能更新,能讲4种地道方言,具备思考能力

量子位 量子位 · 2025-11-28T04:42:59Z

Soul App开源了播客语音合成模型SoulX-Podcast,支持多轮对话和多方言,生成自然流畅的语音,尤其在语音克隆和长对话中表现优异,具备丰富的韵律和情感表达,推动AI与社交结合,提升用户体验。

Soul App开源播客语音合成模型,可流畅自然多轮语音对话,支持川粤豫等多方言与副语言风格

量子位 量子位 · 2025-10-29T08:35:27Z
分析大型语言模型中的方言偏见以评估知识和推理基准

大型语言模型(LLMs)在自然语言处理中的应用广泛,但对非标准英语方言的表现较差。研究显示,将“标准”美式英语问题视为非标准方言变体时,准确率下降可达20%。特定语法规则(如存在性“it”、零连系动词和“y’all”)对多方言的表现影响显著。呼吁未来研究关注高影响力语法结构的偏见缓解方法。

分析大型语言模型中的方言偏见以评估知识和推理基准

Apple Machine Learning Research Apple Machine Learning Research · 2025-10-09T00:00:00Z

早晨温暖,贪睡。阅读《豆汁记》,感受旧时生活。近期电影观影减少,享受多种李子。去成都图书馆听演出,体验四川方言。翻阅《成都街巷志》,学习历史,感叹城市变迁。人民公园中,人们沉迷手机,缺乏交流。晚上点外卖,尝试煮酸梅汤,修理马桶。

入蜀记 day64 旧人旧时旧事

素生 素生 · 2025-07-27T15:58:27Z
Time to Speak Some Dialects, Qwen-TTS!

Qwen-TTS最新版本通过Qwen API更新,使用300万小时语料库训练,合成效果接近人类水平,支持多种方言及中英双语音色,未来将增加更多语言选项。

Time to Speak Some Dialects, Qwen-TTS!

Blog on Qwen Blog on Qwen · 2025-06-27T07:01:34Z

本研究提出FMSD-TTS框架,针对藏语低资源问题,通过少量音频和方言标签生成方言语音,提升了方言表现力和说话人相似性。

FMSD-TTS: Few-Shot Multi-Speaker Multi-Dialect Text-to-Speech Synthesis for Generating U-Tsang, Amdo, and Kham Speech Datasets

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-20T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码