Mistral AI 最近发布了全新的文档识别模型 OCR4,支持170种语言,涵盖10个语族。在 OmniDocBench 测试中,该模型获得了93.07分,用户体验优于 GPT5.5Pro 和 Gemini3.1Pro Preview。
YouTube 的自动配音功能已被数百万频道使用,支持 27 种语言,其中 8 种语言提供更逼真的语音输出。该功能帮助创作者翻译和配音视频,预计到 2025 年每天将有超过 600 万观众观看此类内容。YouTube 还计划增加更多语言和改进配音工具,以更好地服务国际观众。
腾讯推出的轻量级机器翻译模型Hy-MT1.5-1.8B-1.25bit,支持33种语言和1056个翻译方向,翻译效果超越部分大型开源模型。该模型参数仅18亿,用户可在线体验并访问HyperAI官网获取更多资源。
本章介绍如何使用SQLAlchemy构建网页流量分析解决方案,包括扩展数据库以跟踪博客文章和作者、记录用户访问情况以及增加语言支持以跟踪文章语言及翻译关系。这些功能可生成多种查询报告,分析文章流量和用户行为。
Telegram 官方现已支持简体中文和繁体中文,用户无需安装其他语言包。虽然翻译质量仍有待提高,但整体可用。手机版用户可在设置中切换语言,PC 版尚未提供中文支持。
Roblox开发了一种支持16种语言的实时聊天翻译模型,翻译速度约为100毫秒。该模型采用“专家混合”架构,优化了256种语言对的翻译效率,并通过知识蒸馏和量化技术将参数从10亿减少到6.5亿,提升了处理速度。此外,Roblox还建立了质量评估模型,以确保翻译的准确性和流畅性,解决多语言输入和平台特定术语的挑战。
CACTUS与Taylor & Francis续签协议,继续提供AI解决方案Paperpal Preflight,为期刊作者提供定制化语言支持,提高稿件语言质量,减少初筛阶段被拒的风险。
T-Mobile计划在今年春季推出实时翻译功能,支持50多种语言,用户无需特定应用即可使用。该功能将在5G网络上运行,用户只需拨打87即可激活,测试期间免费。实时翻译仅在通话中有效,不会保存通话记录。
OpenAI推出了ChatGPT翻译工具,支持50多种语言,允许用户选择翻译风格,如“更正式”。目前仅支持文本翻译,尚未提供图像支持,且没有独立应用程序。
PaddleOCR于2025年推出了新一代多模态文档解析模型PaddleOCR-VL,支持109种语言,具备高效的文本、表格和公式识别能力。该模型通过两个阶段进行文档解析,显著提升了识别能力和解码效率,适用于多种实际应用场景。
苹果iOS 26.1 Beta 1版新增AirPods实时翻译功能,支持简体中文、繁体中文、日语、韩语和意大利语,利用iPhone的AI实现不同语言用户的直接交流。目前该更新仅面向开发者测试,正式版尚待发布。
Windows 11 的 Microsoft Edge 测试版新增 AI 语音翻译功能,支持将视频音频翻译为西班牙语、韩语和英语。用户需启用相关设置并下载 AI 模型,翻译效果良好,但偶尔会误识别声音性别,未来将增加更多语言支持。
Grammarly正在扩展其语法编辑软件,新增对西班牙语、法语、葡萄牙语、德语和意大利语的支持。该软件利用AI技术提升拼写、句子和段落的清晰度,并可在19种语言间进行翻译。此外,Grammarly计划成为AI生产力应用,收购Superhuman,并推出针对学生和教育者的AI代理。
瑞士推出了名为Apertus的开源AI模型,旨在替代OpenAI的ChatGPT等专有模型。该模型支持1800多种语言,遵循欧盟版权法和自愿AI行为规范,训练数据仅来自公共来源,确保合规性。Apertus的源代码和开发过程在HuggingFace平台上公开。
NotebookLM推出两项重要更新:视频概述支持80种语言,音频概述内容更全面,帮助用户深入理解笔记,节省筛选时间,专注学习与创造。
Ant Design Blazor 1.4.2 版本发布,主要修复了组件的稳定性和性能,优化了 Tabs、Table、Form 等核心组件,新增语言支持并优化了文档。同时修复了交互体验问题,提升了渲染性能,增强了验证逻辑,支持更多本地化语言。
谷歌的AI播客工具Audio Overviews现已支持50多种语言,包括西班牙语、法语和韩语。用户可以在NotebookLM应用中选择输出语言,生成和收听播客式对话。谷歌表示将根据反馈持续改进此功能,并已将其扩展至200多个国家。
谷歌课堂旨在全球变革教学,现已支持55种语言,新增17种语言支持,包括南非荷兰语和法语(加拿大)。用户可根据账户或手机设置自动切换语言,但某些功能可能不支持所有语言。
三月,我们推出了与Gemini实时对话的功能,支持45种语言。用户可通过摄像头或屏幕分享,获得整理空间、创意头脑风暴、故障排除、购物建议和技能反馈等帮助。该功能已在Pixel 9和Samsung Galaxy S25设备上推广。
谷歌的Gemma 3是一个强大的开源AI模型,支持在单个GPU上运行,提供1B、4B、12B和27B四种参数规模,支持140多种语言,具备图像和文本理解能力。该模型可免费下载并本地运行,适合开发者,具有高效性和多模态能力。
完成下面两步后,将自动完成登录并继续当前操作。