小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
CVPR 2026 | PixelDiT:用于图像生成的像素扩散变换器

潜空间建模已成为扩散 Transformer(DiT)的标准范式。然而,它依赖于一个两阶段的流程,其中预训练的自编码器会引入有损重建,导致误差累积并阻碍联合优化。为了解决这些问题,...

CVPR 2026 | PixelDiT:用于图像生成的像素扩散变换器

实时互动网
实时互动网 · 2026-07-30T07:20:10Z
Black Forest Labs发布FLUX 3:用于图像、视频、音频和机器人动作预测的多模态流模型

Black Forest Labs (BFL) 发布了FLUX 3,这是一个多模态基础模型,可在单一架构内学习图像、视频和音频。它也是首个仅使用一组权重即可实现视频、音频和动作预测...

Black Forest Labs发布FLUX 3:用于图像、视频、音频和机器人动作预测的多模态流模型

实时互动网
实时互动网 · 2026-07-27T02:15:48Z
ECCV 2026 | NeFIC:用“下一帧预测”重新定义超低码率图像解码

本文介绍了一种新型超低码率图像压缩方法NeFIC。该方法通过解码锚点帧并利用视频扩散模型进行下一帧预测,提高了解码效率和图像质量。实验结果表明,NeFIC在多个测试集上显著降低了码率,同时保持高感知质量和真实感,节省超过50%的码率。

ECCV 2026 | NeFIC:用“下一帧预测”重新定义超低码率图像解码

实时互动网
实时互动网 · 2026-07-16T03:38:07Z
一层就足够:将预训练视觉编码器适应于图像生成

本文介绍了一种名为FAE(特征自编码器)的框架,旨在将预训练的视觉表示适应为适合图像生成的低维潜在空间。FAE通过单个注意力层和两个深度解码器的结合,实现了高效的图像生成,同时保持了必要的信息。该方法在多个基准测试中表现优异,展现了高质量和快速学习的能力。

一层就足够:将预训练视觉编码器适应于图像生成

Apple Machine Learning Research
Apple Machine Learning Research · 2026-07-15T00:00:00Z
如何使用JavaScript构建基于浏览器的PDF图像提取工具

本文介绍了如何使用JavaScript构建一个基于浏览器的PDF图像提取工具。用户可以上传PDF文件,预览页面,提取嵌入的图像,并按页面组织下载。该工具在本地运行,确保用户隐私,提取的图像保持原始质量,适用于设计、营销、教育等多个行业。

如何使用JavaScript构建基于浏览器的PDF图像提取工具

freeCodeCamp.org
freeCodeCamp.org · 2026-07-13T14:12:57Z
Meta关闭了允许用户制作公共账户AI深度伪造图像的Instagram功能

Meta因用户强烈反对,关闭了允许通过标记公共Instagram账户生成AI图像的功能。该功能未征得账户所有者同意,用户反馈显示未能达到预期,因此决定取消。

Meta关闭了允许用户制作公共账户AI深度伪造图像的Instagram功能

The Verge
The Verge · 2026-07-10T23:49:50Z
字节跳动发布多模态图像创作模型Seedream 5.0 Pro 生图更懂设计

字节跳动于7月9日发布了多模态图像创作模型Seedream 5.0 Pro,该版本在图文匹配和结构合理性等方面有显著提升,具备复杂信息可视化、交互式精准编辑、真实影像质感和多语种支持等核心能力。Seedream 5.0 Pro已上线火山方舟体验中心,后续将在豆包和即梦平台推出。

字节跳动发布多模态图像创作模型Seedream 5.0 Pro 生图更懂设计

TechWeb 全站精华
TechWeb 全站精华 · 2026-07-09T02:49:54Z
ICLR 2026 | 基于视觉自回归模型的前馈式主体驱动图像生成算法 EchoGen

中国科学技术大学与淘天集团提出的EchoGen是首个基于视觉自回归模型的前馈式主体驱动图像生成框架。通过双路径主体注入策略,EchoGen在生成质量与效率上取得平衡,生成1024×1024图像的延迟仅为5.2秒,较现有扩散模型加速2-18倍,适用于实时应用场景。该研究在ICLR 2026上发表,展示了EchoGen在主体保真度和图像质量上的优势。

ICLR 2026 | 基于视觉自回归模型的前馈式主体驱动图像生成算法 EchoGen

实时互动网
实时互动网 · 2026-07-08T09:49:23Z

Nothing于7月7日发布了Ear (3a)无线降噪耳机,配备12毫米动态驱动单元和45分贝主动降噪,续航最长可达42小时。耳机支持音频录制和转录功能,外观透明,售价99美元。

派早报:Nothing Ear (3a) 发布、Meta 推出 Muse 图像生成模型等

少数派
少数派 · 2026-07-07T23:48:25Z

Gemma 4是谷歌DeepMind推出的文档解析工具,能够处理扫描和数字PDF,提取发票信息。它通过将PDF页面渲染为高分辨率图像,利用视觉语言模型读取内容,克服传统文本提取工具的局限性。该工具支持灵活的视觉令牌预算,以适应不同文档的复杂性,确保高效准确的提取。

使用Gemma 4进行零样本本地文档解析:将PDF视为图像

KDnuggets
KDnuggets · 2026-07-07T14:00:04Z
emoji 也能控制语音生成?Irodori-TTS 基于 RF-DiT 架构的日语 TTS;Eczema and Tinea Skin Disease 数据集:支持医学图像分类与迁移学习

Irodori-TTS是由开发者Aratako于2026年发布的日语语音合成项目,具有高保真音质和零样本声音克隆能力。核心模型Irodori-TTS-500M-v3支持48 kHz专业音频输出,用户只需提供3-10秒的参考音频即可精准复刻目标音色,并通过Emoji注释调节情绪和语调。

emoji 也能控制语音生成?Irodori-TTS 基于 RF-DiT 架构的日语 TTS;Eczema and Tinea Skin Disease 数据集:支持医学图像分类与迁移学习

HyperAI超神经
HyperAI超神经 · 2026-07-03T09:07:54Z
Nano Banana 2 Lite(Gemini 3.1 Flash Lite图像)现已在AI Gateway上线

谷歌的Nano Banana 2 Lite现已在AI Gateway上线,支持快速、低成本的图像生成,生成时间少于4秒,且编辑现有图像的成本降低至每张1K图像0.034美元,约为Nano Banana 2的一半。用户可通过AI SDK使用该模型,支持文本和图像的多模态生成。AI Gateway提供统一的API,便于调用模型和跟踪使用情况。

Nano Banana 2 Lite(Gemini 3.1 Flash Lite图像)现已在AI Gateway上线

Vercel News
Vercel News · 2026-06-30T00:00:00Z

Gemini应用通过个人智能技术,为用户提供个性化的图像生成体验。用户只需输入提示,如“设计我的梦想房子”,即可生成图像,无需上传照片。该应用与Google工具连接,自动提取用户信息,提高创作效率,用户可随时调整连接设置。

Gemini应用将个性化图像创作带给更多用户。

The Keyword
The Keyword · 2026-06-29T17:30:00Z
4步出图/4K画质/6倍提速,PiD用像素扩散统一解码与超分辨率输出;SA-3DAO:包含 1000 组真实图像与艺术家手工 3D 网格配对的数据集

NVIDIA 发布的 PiD 是一种新型潜空间解码范式,通过条件像素扩散生成取代传统 VAE 解码,解决了高分辨率图像生成的限制。PiD 利用轻量级噪声感知适配器和 DMD2 蒸馏技术,仅需 4 步去噪即可生成清晰的 4K 图像,显著提升了图像质量。

4步出图/4K画质/6倍提速,PiD用像素扩散统一解码与超分辨率输出;SA-3DAO:包含 1000 组真实图像与艺术家手工 3D 网格配对的数据集

HyperAI超神经
HyperAI超神经 · 2026-06-26T06:14:38Z
五个开放源代码的全能AI模型:处理文本、图像、音频和视频

近年来,开放源代码的全能AI模型逐渐成熟,能够统一处理文本、图像、音频和视频。本文介绍了五个前沿模型:NVIDIA的Nemotron 3、Google的Gemma 4、Qwen3-Omni、DeepSeek的Janus-Pro和MiniCPM-o 4.5。这些模型在多模态理解、实时交互和生成能力方面表现出色,适用于客户支持、文档分析和实时语音对话等应用场景。全能模型的出现使AI在实际工作流程中更加高效和自然。

五个开放源代码的全能AI模型:处理文本、图像、音频和视频

KDnuggets
KDnuggets · 2026-06-25T14:00:07Z
徕卡6690美元的SL3-P相机配备4400万像素静态图像与8K视频

徕卡推出新款SL3-P相机,售价6690美元,配备4400万像素传感器和8K视频录制功能,支持高达40帧每秒的连拍,具备防水防尘设计,适合专业摄影使用。

徕卡6690美元的SL3-P相机配备4400万像素静态图像与8K视频

The Verge
The Verge · 2026-06-25T13:00:00Z
如何在Google Sheets中插入图像

Google Sheets可以插入和显示图像,以提高数据可读性。用户可通过插入菜单或IMAGE()函数添加图像,图像可以放在单元格内或浮动在单元格上。对于大量图像,使用Drive Explorer Pro工具可自动生成图像链接,简化管理。选择合适的方法可以提高工作效率。

如何在Google Sheets中插入图像

freeCodeCamp.org
freeCodeCamp.org · 2026-06-24T22:09:25Z
Seed 2.1、Seedance 2.5发布,图像、语音模型同步上新

在火山引擎FORCE大会上,发布了豆包大模型2.1 Pro等五大模型,全面升级多模态生成技术。豆包大模型日均Token调用量突破180万亿,成为中国公有云市场的领导者。同时,火山引擎推出AI云原生架构,支持企业高效使用Agent,确保安全合规。新发布的Seedance 2.5和音频生成模型1.0进一步降低了高质量内容生产门槛。

Seed 2.1、Seedance 2.5发布,图像、语音模型同步上新

实时互动网
实时互动网 · 2026-06-23T07:17:09Z
Darktable 5.6 开源 RAW 图像编辑器发布,新增 AI 功能

Darktable 5.6于2026年6月21日发布,新增AI子系统、神经恢复模块和色彩协调器模块,支持HEIF格式,增加对新相机的支持,并引入触摸板手势和新白平衡预设。

Darktable 5.6 开源 RAW 图像编辑器发布,新增 AI 功能

实时互动网
实时互动网 · 2026-06-22T03:31:19Z
如何在Node.js中使用QVAC和Socket.io构建离线AI图像生成器

近年来,AI图像生成技术取得显著进展。使用QVAC SDK,用户可以在本地运行Stable Diffusion模型,无需API密钥或订阅费用,支持离线生成图像,确保隐私和成本控制。文章介绍了如何使用Node.js和Socket.io构建本地应用程序,实现图像生成的过程和技术细节。

如何在Node.js中使用QVAC和Socket.io构建离线AI图像生成器

freeCodeCamp.org
freeCodeCamp.org · 2026-06-18T16:05:23Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码