OpenAI发布新一代图像生成模型ChatGPT Images 2.5,重点提升细节质量、编辑精度和修改一致性,支持精准局部调整及多轮修改。新增Sketch手绘参考、模板和图片评论编辑功能。实测显示人物特征保持和复杂风格理解增强,但仍有噪点问题。同步推出API模型Flare和Sunburst,面向不同应用场景。
OpenAI推出Images 2.5图像生成模型,生成速度提升50%,改进透明背景和多轮编辑稳定性,能更好保留主体特征。API提供Flare和Sunburst两种模型,分别面向通用和精细编辑场景。目前每周生成图片超30亿张。
OpenAI更新ChatGPT图像生成工具,新增Sketch功能,用户可绘制草图并据此生成图像,还能对图像部分添加评论以修改细节。新版本ChatGPT Images 2.5提升光照和纹理效果,编辑指令遵循更佳,生成速度比2.0快50%,现已向桌面、移动和网页端用户开放。
OpenAI 的 GPT Image 2.5 Flare 和 Sunburst 模型现已在 AI Gateway 上线,支持生成和编辑图像,具备自然光照、复杂指令处理及透明背景等功能。Flare 优化快速生成,Sunburst 提供精细控制,两者均可通过参考图像进行定向编辑。AI Gateway 提供统一 API,无加价收费。
商汤科技发布SenseNova-U1.5-8B-MoT统一多模态模型,支持图像生成、编辑与理解,提升4K画质和文字渲染。HyperAI官网更新数据集、教程及百科词条,涵盖语音、地震数据及多模态模型部署,并预告9月截稿顶会。
dsh-image-gen是DeepSeek Harness的AI图像插件,支持对话生图、连续编辑、Studio批量创作、多模型对比、500+Prompt灵感库及本地ComfyUI集成。用户可在聊天框内完成全流程图像操作,无需切换界面,支持BYOK模式,安装简单,五分钟内可出图。目前ComfyUI不支持Studio和多模型对比,是待完善点。
蚂蚁集团开源统一图像生成与编辑模型LLaDA-Image,含6B参数,提供Base和Turbo两版本,支持文生图、编辑及中英文渲染。Turbo采用蒸馏技术,仅需4步采样。模型在Qwen-Image-Bench上得分领先,并公开权重与推理代码。
Meta Superintelligence Labs的Muse Image模型已上线AI Gateway,这是其首个图像模型,支持文本生成图像和图像编辑。用户可通过AI SDK调用,设置模型为meta/muse-image-1.0,使用generateImage功能,并支持参考图像混合。AI Gateway提供统一API、成本追踪、故障转移和性能优化,无加价或平台费。
xAI的Grok Imagine Image 2.0预览版已在AI Gateway上线,能精确遵循指令,规划排版与布局,生成信息图、海报等复杂视觉内容,并支持图像编辑,保持主体一致性。用户可通过AI SDK调用,设置模型为xai/grok-imagine-image-2.0-preview,选择1k或2k分辨率,并支持多图生成及基于提示的图像修改。
本文介绍如何在Claude.ai网页版通过MCP协议接入字节跳动的Seedream图像生成模型。步骤包括:添加Connector、OAuth授权、设置Always allow,然后可用中文或英文prompt生成、编辑图片,支持多种尺寸和批量操作。实测生成16:9水彩凤凰图,约20-40秒完成,图片链接长期有效。
本文介绍Nano Banana MCP Server的对接方法。该服务通过AceData Cloud提供AI图像生成与编辑功能,支持Claude、VS Code、Cursor等客户端。文章详述两种接入方式:推荐使用云端托管MCP(零安装,填写URL和API Token),或本地安装(pip/uvx)。核心功能包括图像生成、编辑、虚拟试衣等,并列出可用工具及使用示例。
本文研究扩散Transformer(DiT)中的异常标记问题,发现其在编码器和去噪器中均存在,且简单掩蔽无效。提出双阶段寄存器(DSR)干预方法,通过训练或测试时寄存器及扩散寄存器,在ImageNet和文本到图像生成中减少异常伪影,提升生成质量,强调控制异常标记对构建更强DiT的重要性。
本文介绍如何在OpenCode中配置Flux MCP Server,以调用Flux图像生成与编辑模型。需先获取Ace Data Cloud API Token,并在opencode.json中设置远程MCP,注意关闭OAuth并启用Bearer鉴权。配置成功后可用自然语言生成或编辑图片,建议使用OpenAI系列模型以确保工具调用稳定。
微软开源Mage-Flow,一款仅4B参数的紧凑图像生成模型,通过Tokenizer-Backbone-System设计,在图像生成和编辑上媲美20B-32B大模型,推理更快、显存更省。支持中英文文生图、指令编辑及Gradio交互,单张A100上1024×1024出图仅0.59秒,已在HyperAI上线供低成本体验。
Google Earth新增Nano Banana 2图像生成功能,用户可基于真实卫星和3D影像输入文字生成定制图像。五种用途包括还原历史场景(如庞贝古城)、制作信息图、规划房地产项目、可视化建筑方案及创意改造地标。该功能已向全球网页版用户开放。
PixelDiT提出单阶段端到端像素空间扩散Transformer,无需VAE,采用补丁级和像素级双层架构,结合像素级AdaLN与Token压缩,高效建模全局语义和局部纹理。在ImageNet 256×256达1.61 FID,文生图GenEval 0.74,逼近潜空间模型,并避免VAE重建伪影,利于细节保留。
Midjourney收购了占星应用Co-Star,其创始人Banu Guler将加入并担任首席设计官,同时继续负责该应用。此次收购旨在帮助Midjourney开发首批应用,包括图像生成应用。目前Midjourney的AI模型主要通过网页和Discord提供服务。
本文介绍视觉概念推断任务(VICIS),要求模型从少量示例图像中提取共享概念,并应用于新查询图像生成。现有视觉语言模型在此任务上表现不佳,常忽略视觉上下文或产生偏见输出。作者提出训练框架和架构,学习从图像集合推断概念并提取查询特定嵌入。实验表明,该方法在合成数据和ImageNet/WordNet数据上生成更准确多样,且能泛化至未见概念和草图等模态。
Flux MCP 是 Anthropic 推出的模型上下文协议,允许 AI 模型通过标准化接口调用外部工具。用户可通过 AceData Cloud 的 Flux MCP Server 在多个 AI 客户端中生成和编辑图像。使用前需获取 API Token,并可选择托管或本地运行服务,支持文本生成图像和图像编辑功能,用户可通过自然语言调用这些功能。
本文介绍了一种名为FAE(特征自编码器)的框架,旨在将预训练的视觉表示适应为适合图像生成的低维潜在空间。FAE通过单个注意力层和两个深度解码器的结合,实现了高效的图像生成,同时保持了必要的信息。该方法在多个基准测试中表现优异,展现了高质量和快速学习的能力。
完成下面两步后,将自动完成登录并继续当前操作。