苹果公司推出了PICO图像压缩编解码器,利用机器学习生成高质量图像,具有优越的压缩率和视觉质量,处理速度快。PICO结合了人眼视觉优化和多种损失函数,提升了图像感知质量,但在简单合成图像上的效果可能不如传统方法。
极佳视界的GigaWorld-1模型在WorldArena评测中获得全球第一,超越谷歌和英伟达,展现出在物理遵循、3D准确度和视觉质量方面的领先技术,推动具身智能生态的发展。
Gemini 3.1 Flash Image Preview(Nano Banana 2)现已在AI Gateway上线。该版本提升了视觉质量,支持Google图像搜索,能更好地渲染不知名地标和物体,并引入可配置的思维水平。新增分辨率和纵横比,支持更多创意资产。使用时需设置模型为google/gemini-3.1-flash-image-preview。
游戏开发者应重视分辨率,它是视觉质量的基础。分辨率影响艺术资产的缩放、UI显示和不同设备上的游戏体验。高分辨率提供更多细节,但需优化以避免帧率下降。开发者应测试不同分辨率,确保游戏在各种设备上表现一致。理解分辨率、缩放和像素密度的关系,有助于提升游戏的视觉效果和可玩性。
本文介绍了JoyGen框架,该框架通过130小时中文视频数据集解决了音频与唇部动作的同步及视觉质量问题,推动了AIGC领域的发展。
PosterAgent是一个开源框架,可以将学术论文快速转换为高质量海报,效果优于GPT-4o,且成本低。它通过Paper2Poster评估标准,优化海报的视觉效果和文本连贯性,适合学术会议和课程资料制作。
在竞争激烈的游戏开发中,视觉质量至关重要。传统的手动验证方法已不再有效,导致渲染缺陷难以发现。我们通过将基于图像的机器学习分类集成到DevOps流程中,实现了自动化视觉验证,提升了开发效率。该系统成功识别了多个关键回归问题,显著提高了开发流程的可靠性和稳定性。
本研究提出了ManipDreamer,通过引入动作树和视觉引导,显著提升了机器人操控视频合成中的指令跟随和视觉质量。
本研究提出了一种新方法4DGS-1K,旨在解决现有4D高斯散点技术在动态场景重建中的存储需求和渲染速度问题。该方法通过引入时空变化评分,显著降低了存储需求,并实现了超过1000帧每秒的渲染速度,同时保持了视觉质量。
本研究探讨了单图像超分辨率(SISR)的挑战,提出了一种通过多模态上下文信息(如深度、分割、边缘和文本提示)在扩散模型中学习生成先验的新方法。实验结果表明,该模型在视觉质量和保真度上优于现有方法,具有重要的应用潜力。
本研究提出了一种对角解码方法,解决自回归Transformer模型在视频生成中的速度瓶颈。该方法通过利用时空相关性,实现帧内并行解码,推断速度提升最高可达10倍,同时保持视觉质量。
Wan-2.1-1.3b是由Wan-Video维护的先进视频生成模型,能够根据文本描述生成5秒480p的视频。该模型采用扩散变换器架构,支持中英文输入,具备良好的视觉质量和运动连贯性,用户可调整参数以控制生成过程。
本研究提出了一种一致性流动蒸馏(CFD)方法,以解决文本到3D生成中的视觉质量和多样性问题。实验结果表明,CFD方法显著优于传统技术。
本研究提出了一种改进的耦合归一化流模型,旨在提升自然图像生成的视觉质量。尽管整体质量仍有待提高,但在数量和质量性能上已达到先进水平,展现了其在复杂生成模型中的潜力。
该研究提出了一种混合训练框架,结合静态图像与视频数据,解决了视频人脸交换在时间一致性和复杂场景处理中的不足,显著提高了身份保持和视觉质量。
本研究提出了一种名为HUPE的启发式可逆网络,旨在解决水下图像因光折射和吸收导致的可视性降低问题。HUPE通过可逆变换与傅里叶变换实现水下图像与清晰图像的双向映射,并引入语义协同学习模块,显著提升视觉质量和特征提取能力。实验结果表明,HUPE的增强效果优于现有方法。
本研究提出了向量化粒子基得分蒸馏(VPSD)方法,显著提升了文本指导的SVG生成在可编辑性、视觉质量和多样性方面的表现。实验结果表明,该方法优于传统技术,并支持多种向量风格。
本研究提出了一种低复杂度的实时超分辨率模型RTSR,旨在提升视频压缩内容的视觉质量,特别是从360p到1080p及540p到4K的分辨率。该模型通过优化的卷积神经网络和双教师知识蒸馏方法,实现了复杂性与编码性能的最佳平衡,为实时视频播放提供了有效解决方案。
本研究提出线性情感空间(LES)和跨维注意力网络(CDAN),以解决一体化虚拟人物生成模型在细粒度情感编辑中的不足。实验结果表明,该方法在视觉质量和可控性方面优于主流技术。
本研究提出了LapGSR模型,旨在解决低分辨率图像在多模态数据融合中的视觉质量问题。该模型通过拉普拉斯金字塔提取边缘信息,降低计算负担,同时保持图像细节。实验结果表明,LapGSR在ULB17-VT和VGTSR数据集上表现优异,且参数数量显著少于其他模型。
完成下面两步后,将自动完成登录并继续当前操作。