小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

作者用Astro重构博客,弃用SvelteKit,经三次Codex开发实现静态站点生成器,保留原页面表现。新增动态多语言路由和交互服务,评论数据存本地并渲染为静态页。还加入作者声明、数字签名与时间戳防抄袭功能,部署于Cloudflare Worker。

用 Astro 重构博客程序:从 SvelteKit 到静态站点

Dallas Lu Dallas Lu · 2026-09-02T01:02:00Z
Meta刚刚在实时转录领域击败了OpenAI和Google

Meta推出实时语音识别模型Muse Voice Transcribe,支持70多种语言、区分20多位说话者及长对话,在基准测试中词错误率3.1%,优于竞品。模型采用自适应延迟机制,通过强化学习平衡准确性与速度。API定价每小时0.18美元,但不开放权重。Meta因眼镜和Mac应用等产品需求,持续推动该技术发展。

Meta刚刚在实时转录领域击败了OpenAI和Google

The New Stack The New Stack · 2026-09-01T17:06:57Z
Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

Gradium AI发布新TTS模型并设为默认,在500句难例测试中人工评分通过率81%,领先Cartesia和ElevenLabs。首音频延迟216毫秒,低且稳定。支持多语言,无需文本归一化即可准确朗读号码和邮箱。基准测试由厂商运行,评估集已开源。

Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

实时互动网 实时互动网 · 2026-09-01T06:35:17Z
谷歌发布Gemini 3.5 Transcribe语音转文字模型 提升实时转写准确率和多语言能力

谷歌发布Gemini 3.5 Transcribe语音转文本模型,提升实时转写准确率、降低延迟,支持85种语言,自动去除口头语并修正表达,可区分说话者。流式转写延迟低于1秒,错误率低至2.6%。已通过Gemini API公开预览,未来支持Chrome浏览器。

谷歌发布Gemini 3.5 Transcribe语音转文字模型 提升实时转写准确率和多语言能力

蓝点网 蓝点网 · 2026-08-27T03:16:33Z

谷歌发布Gemini 3.5 Transcribe语音转文字模型,支持实时流式与预录音频处理,词错率低至2.6%,覆盖85种语言,可识别自定义词汇、多说话人及自动清理语气词。该模型已集成至Gemini应用、Android及开发者API,并获合作伙伴好评。

Gemini 3.5 Transcribe 智能转录

Google DeepMind Blog Google DeepMind Blog · 2026-08-26T17:01:00Z
数据约束下通过词汇干预实现的多语言知识迁移

本文提出LINK方法,通过双语词汇表对高资源语言(英语)预训练数据进行词汇替换,实现跨语言知识迁移。该方法无需额外模型训练或平行数据,仅需低成本双语词典。在八种语言、五种模型规模上评估显示,目标语言下游任务性能显著提升,训练速度最高提升2倍。

数据约束下通过词汇干预实现的多语言知识迁移

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-20T00:00:00Z
超越英语的GRPO:非英语与多语言环境下GRPO的大规模研究

该研究大规模探讨了非英语和多语言环境下的GRPO训练,发现用母语推理训练与英语训练效果差距小,且跨语言迁移强,但具体表现因模型和语言而异,某些语言训练可能导致其他语言能力严重退化。因此,RLVR虽能带来广泛跨语言收益,但需全面评估以检测特定语言退化。

超越英语的GRPO:非英语与多语言环境下GRPO的大规模研究

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-18T00:00:00Z
微软:人工智能初学者课程,一共12周、24节课

微软开源AI初学者课程,获6万多Star,支持多语言。课程共12周24节课,涵盖TensorFlow、PyTorch及AI伦理,内容从环境设置、AI历史到神经网络、计算机视觉、自然语言处理、强化学习等,附实验与测验,适合学生及自学者。

微软:人工智能初学者课程,一共12周、24节课

小众软件 小众软件 · 2026-08-06T08:38:00Z
超越转录:对话式语音识别 (CSR) 如何教会 AI 真正倾听

对话式语音识别(CSR)正取代传统自动语音识别,通过理解对话的实时展开、轮流发言和时机,实现低延迟响应。它支持多语言切换,已在客服、医疗、金融等领域应用,推动人机交互更自然、更人性化,成为下一代语音AI的基础。

超越转录:对话式语音识别 (CSR) 如何教会 AI 真正倾听

实时互动网 实时互动网 · 2026-08-04T02:28:15Z
在语音模式下思考难题

Claude语音模式升级,现支持Opus和Sonnet模型,可进行深度对话和问题解决。用户可切换模型,练习演讲、头脑风暴、评估假设等。语音模式支持多语言切换,并能连接工具执行任务,如调整日程、生成文档、回复邮件。该功能对所有用户开放,付费计划可使用更多模型和工具。

在语音模式下思考难题

Claude Claude · 2026-07-24T17:01:50Z
数据集汇总丨英伟达开源Nemotron系列数据集,超10T tokens+40M 条后训练样本,覆盖数学推理/代码生成/多语言对话

训练数据在大模型竞争中至关重要,NVIDIA推出的Nemotron系列数据集强调数据质量和任务适配性,涵盖通用文本预训练、监督微调和代码生成等核心能力,推动模型训练从数量向精准转变。这些数据集为大模型研究提供系统性支持,提升模型能力。

数据集汇总丨英伟达开源Nemotron系列数据集,超10T tokens+40M 条后训练样本,覆盖数学推理/代码生成/多语言对话

HyperAI超神经 HyperAI超神经 · 2026-07-17T08:06:36Z
苹果音乐的多语言语义检索

苹果音乐推出了一种多语言语义检索系统,旨在提升搜索质量,特别是对拼写错误和跨语言查询的响应。该系统基于305M参数的双编码器模型,经过多目标训练优化。在线测试显示,整体转化率提升2.28%,无结果率减少86%,尾部查询转化率提升7.93%,证明了语义检索在困难查询中的有效性。

苹果音乐的多语言语义检索

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-14T00:00:00Z
OCR 教程汇总丨覆盖长文档/端到端/多语言,百度/小红书/华中科大等面向不同场景开源高性能模型,实现多模态文档精准解析

随着大模型的发展,OCR技术成为连接视觉数据与智能应用的重要工具。新一代多模态模型整合了文字识别和信息抽取等功能,推动了OCR在科研、金融和医疗等领域的应用。本文介绍了五款开源OCR模型,包括Unlimited-OCR、Chandra-ocr-2、dots.mocr、Qianfan-OCR和FireRed-OCR,适用于文档解析和手写文字处理等场景,帮助开发者选择合适的解决方案。

OCR 教程汇总丨覆盖长文档/端到端/多语言,百度/小红书/华中科大等面向不同场景开源高性能模型,实现多模态文档精准解析

HyperAI超神经 HyperAI超神经 · 2026-07-13T09:31:26Z

BGE-M3是一款全能型嵌入模型,支持密集、稀疏和多向量检索,覆盖100多种语言,最大输入长度为8192词元。其量化版bge-m3-q8_0在GPUNexus平台上线,显存占用减少,推理速度提升,适合RAG系统和多语言知识库。2026年第三季度可免费试用。

【免费用3月】BGE-M3 全能多粒度嵌入模型:三合一检索、百种语言、超长上下文,量化版上线算纽GPUNexus

Rust.cc Rust.cc · 2026-07-07T05:50:31Z
JetBrains在微软的多语言退出几个月后终止Kotlin Notebook,但Jupyter表现良好。

JetBrains宣布将停止Kotlin Notebook插件并将其开源,原因是未能达到预期的用户接受度。随着AI工具的兴起,开发者的工作方式发生变化,传统的笔记本文化在Python社区更为盛行。相较之下,Google Colab始终服务于数据科学家,未遇到类似问题。这一决定反映了JetBrains对未来方向的重新评估。

JetBrains在微软的多语言退出几个月后终止Kotlin Notebook,但Jupyter表现良好。

The New Stack The New Stack · 2026-06-29T17:59:29Z
AI 聊天机器人在跨境电商中的多语言客服实践

跨境电商客服面临多语言和时差挑战。AI 聊天机器人通过多语种技术实现 7×24 小时服务,降低成本并提高响应速度。即构科技的 ZEGO AI Agent 提供多种客服模式,显著提升客户满意度和市场表现。

AI 聊天机器人在跨境电商中的多语言客服实践

实时互动网 实时互动网 · 2026-06-29T09:28:42Z

sigil-stitch 是一个 Rust 库,旨在简化多语言代码生成。它自动追踪类型引用,处理重名冲突,支持不同宽度的输出,并能生成多种语言的代码。用户可以通过 builder API 或 sigil_quote! 直接编写目标语言片段。当前版本为 0.6.8,欢迎反馈使用体验和改进建议。

sigil-stitch:用 Rust 做类型安全、自动 import、宽度感知的多语言代码生成

Rust.cc Rust.cc · 2026-06-26T06:46:35Z
出海社交 App 的实时翻译功能怎么接:多语言场景的技术路径对比

出海社交产品需要实时翻译以促进不同语言用户的互动,常见场景包括1v1跨语种匹配、直播间观众翻译和IM消息翻译。接入方案有三种:纯第三方API集成、RTC厂商生态集成和混合方案。选择时需考虑语种覆盖、延迟、成本和隐私合规。ZEGO的实时传译方案提供低延迟和低集成成本,适合大多数出海社交团队。

出海社交 App 的实时翻译功能怎么接:多语言场景的技术路径对比

实时互动网 实时互动网 · 2026-06-25T07:37:48Z
社交 App 内容审核的平衡难题:日活用户和合规红线怎么兼顾

出海社交应用的内容审核面临多语言和合规标准的挑战。过度审核可能导致用户流失,因此需要在合规与用户体验之间找到平衡。审核策略应减少误杀率,确保正常内容不被误判。建议使用第三方审核服务,并根据市场需求定制敏感词库,以提高审核效率和准确性。

社交 App 内容审核的平衡难题:日活用户和合规红线怎么兼顾

实时互动网 实时互动网 · 2026-06-25T03:33:38Z
什么是 Git 工作树,它们为什么值得使用?

GitHub推出了一个新的开放数据集,帮助研究人员和开发者发现多语言开发内容。同时,GitHub Copilot CLI的改进提高了任务分配的效率,促进了工作进展。

什么是 Git 工作树,它们为什么值得使用?

The GitHub Blog The GitHub Blog · 2026-06-16T20:58:54Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码