小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

本研究提出了一套自动评估指标,旨在改进图像再创造的评估机制。该指标基于机器翻译,涵盖对象、嵌入和视觉语言模型。研究发现,专有视觉语言模型在文化相关性和语义等价性方面表现最佳,而视觉编码器在视觉相似性测量上表现突出,为图像再创造的自动评估提供了理论和实践框架。

Towards Automatic Evaluation for Image Transcreation

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-12-18T00:00:00Z

本研究提出了一套基于明示错误分析及 MQM 框架的机器翻译评估方法,并应用于 WMT 2020 挑战赛。评估结果显示,自动评估指标基于预训练嵌入的表现足以胜过人工众包评估,为今后的研究提供公共语料库。

评估最佳参考翻译

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2023-11-28T00:00:00Z

本文提出了用于评估文本到视频生成的基准FETV,并对四个T2V模型进行了手动评估。研究发现自动评估指标与人工评估相关性较差,提出了两个新的自动评估指标与人工评估相关性更高。

FETV:开放领域文本视频生成的细粒度评估基准

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2023-11-03T00:00:00Z

本研究提出了一种简单的降低标注成本的方法,通过分层抽样和控制变量等技术,结合成员身份信息和自动评估指标,在固定标注预算下提高准确性。在测试集上,相比纯随机抽样,平均误差降低了20%。易于实现且适用于类似结构的问题。

Thresh: 统一的、可定制和可部署的细粒度文本评估平台

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2023-08-14T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码