小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

本研究提出了一种基于音段语音声学特征的深伪音频检测方法。这些特征与人类发音过程密切相关,难以被深伪模型复制。研究结果表明,某些音段特征在识别深伪音频方面表现优异,为法医学音频检测提供了新思路。

Forensic Deepfake Audio Detection Based on Segmental Speech Features

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-20T00:00:00Z

使用OpenAI的Whisper模型为视频自动生成字幕。首先安装Miniconda和CUDA,创建whisper环境,安装cuDNN和PyTorch。然后使用Whisper识别音频生成字幕,最后用FFmpeg将字幕添加到视频中。

利用 whisper 为视频自动生成字幕

御坂研究所 御坂研究所 · 2025-01-02T10:37:24Z

本文探讨了大卷积核在卷积神经网络(CNN)中的应用,提出了设计高效CNN的指南,并展示了其在图像识别、时间序列预测和音频识别中的优越性能。研究表明,大核卷积网络在鲁棒性和准确性上可与视觉变换器相媲美,同时通过优化架构提升计算效率。

扩大你的卷积核:朝向通用表示的大卷积核设计在卷积网络中的应用

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-10-10T00:00:00Z

DiaCorrect是一种错误修正框架,可改进音频识别系统的输出。该方法包括两个卷积编码器和一个基于转换的解码器,通过利用输入录音和初始系统输出之间的相互作用,自动校正初始说话者活动以最小化识别错误。实验表明,DiaCorrect可以有效地改善初始模型的结果。

DiaCorrect: 说话人分离的纠错后端

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2023-09-15T00:00:00Z

该论文提出了一种面向低资源语言的强大的视觉语音识别方法,使用Whisper模型进行语言识别和基于音频的语音识别,从而在没有人工注释的情况下获得与人工注释标签相似的VSR性能,并提供了大规模无标注多语言数据库的自动标签。

利用 Whisper 模型的自动标签实现低资源语种的视觉语音识别

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2023-09-15T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码