小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
GPT Images 2.5 突发上线!网友的「灵魂画作」一个比一个离谱

OpenAI发布新一代图像生成模型ChatGPT Images 2.5,重点提升细节质量、编辑精度和修改一致性,支持精准局部调整及多轮修改。新增Sketch手绘参考、模板和图片评论编辑功能。实测显示人物特征保持和复杂风格理解增强,但仍有噪点问题。同步推出API模型Flare和Sunburst,面向不同应用场景。

GPT Images 2.5 突发上线!网友的「灵魂画作」一个比一个离谱

爱范儿 爱范儿 · 2026-09-09T10:37:37Z
OpenAI推出图像生成模型Images 2.5 生成速度提升50%/改进透明背景/支持多轮编辑

OpenAI推出Images 2.5图像生成模型,生成速度提升50%,改进透明背景和多轮编辑稳定性,能更好保留主体特征。API提供Flare和Sunburst两种模型,分别面向通用和精细编辑场景。目前每周生成图片超30亿张。

OpenAI推出图像生成模型Images 2.5 生成速度提升50%/改进透明背景/支持多轮编辑

蓝点网 蓝点网 · 2026-09-09T04:09:17Z
ChatGPT Sketch 将你的糟糕画作转化为精细的AI图像

OpenAI更新ChatGPT图像生成工具,新增Sketch功能,用户可绘制草图并据此生成图像,还能对图像部分添加评论以修改细节。新版本ChatGPT Images 2.5提升光照和纹理效果,编辑指令遵循更佳,生成速度比2.0快50%,现已向桌面、移动和网页端用户开放。

ChatGPT Sketch 将你的糟糕画作转化为精细的AI图像

The Verge The Verge · 2026-09-08T20:16:09Z
GPT Image 2.5 Flare 和 Sunburst 现已在 AI Gateway 上线

OpenAI 的 GPT Image 2.5 Flare 和 Sunburst 模型现已在 AI Gateway 上线,支持生成和编辑图像,具备自然光照、复杂指令处理及透明背景等功能。Flare 优化快速生成,Sunburst 提供精细控制,两者均可通过参考图像进行定向编辑。AI Gateway 提供统一 API,无加价收费。

GPT Image 2.5 Flare 和 Sunburst 现已在 AI Gateway 上线

Vercel News Vercel News · 2026-09-08T00:00:00Z
SenseNova-U1.5-8B-MoT 统一生成与理解,解锁原生多模态创作;DeepSeek-V4-Flash-Vision-Exp 拓展视觉理解新能力

商汤科技发布SenseNova-U1.5-8B-MoT统一多模态模型,支持图像生成、编辑与理解,提升4K画质和文字渲染。HyperAI官网更新数据集、教程及百科词条,涵盖语音、地震数据及多模态模型部署,并预告9月截稿顶会。

SenseNova-U1.5-8B-MoT 统一生成与理解,解锁原生多模态创作;DeepSeek-V4-Flash-Vision-Exp 拓展视觉理解新能力

HyperAI超神经 HyperAI超神经 · 2026-09-05T09:47:19Z
开源dsh-image-gen:在DeepSeek Harness聊天框直接生图修图

dsh-image-gen是DeepSeek Harness的AI图像插件,支持对话生图、连续编辑、Studio批量创作、多模型对比、500+Prompt灵感库及本地ComfyUI集成。用户可在聊天框内完成全流程图像操作,无需切换界面,支持BYOK模式,安装简单,五分钟内可出图。目前ComfyUI不支持Studio和多模型对比,是待完善点。

开源dsh-image-gen:在DeepSeek Harness聊天框直接生图修图

极道 极道 · 2026-09-04T10:00:00Z
蚂蚁 inclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image

蚂蚁集团开源统一图像生成与编辑模型LLaDA-Image,含6B参数,提供Base和Turbo两版本,支持文生图、编辑及中英文渲染。Turbo采用蒸馏技术,仅需4步采样。模型在Qwen-Image-Bench上得分领先,并公开权重与推理代码。

蚂蚁 inclusionAI 开源 6B 统一图像生成与编辑模型 LLaDA-Image

实时互动网 实时互动网 · 2026-09-04T06:39:24Z
Muse Image现已上线AI Gateway

Meta Superintelligence Labs的Muse Image模型已上线AI Gateway,这是其首个图像模型,支持文本生成图像和图像编辑。用户可通过AI SDK调用,设置模型为meta/muse-image-1.0,使用generateImage功能,并支持参考图像混合。AI Gateway提供统一API、成本追踪、故障转移和性能优化,无加价或平台费。

Muse Image现已上线AI Gateway

Vercel News Vercel News · 2026-08-26T00:00:00Z
Grok Imagine Image 2.0 现已登陆 Vercel AI Gateway

xAI的Grok Imagine Image 2.0预览版已在AI Gateway上线,能精确遵循指令,规划排版与布局,生成信息图、海报等复杂视觉内容,并支持图像编辑,保持主体一致性。用户可通过AI SDK调用,设置模型为xai/grok-imagine-image-2.0-preview,选择1k或2k分辨率,并支持多图生成及基于提示的图像修改。

Grok Imagine Image 2.0 现已登陆 Vercel AI Gateway

Vercel News Vercel News · 2026-08-08T00:00:00Z
Claude 对接 Seedream MCP

本文介绍如何在Claude.ai网页版通过MCP协议接入字节跳动的Seedream图像生成模型。步骤包括:添加Connector、OAuth授权、设置Always allow,然后可用中文或英文prompt生成、编辑图片,支持多种尺寸和批量操作。实测生成16:9水彩凤凰图,约20-40秒完成,图片链接长期有效。

Claude 对接 Seedream MCP

静觅 静觅 · 2026-08-06T20:33:11Z
Nano Banana MCP 对接指南

本文介绍Nano Banana MCP Server的对接方法。该服务通过AceData Cloud提供AI图像生成与编辑功能,支持Claude、VS Code、Cursor等客户端。文章详述两种接入方式:推荐使用云端托管MCP(零安装,填写URL和API Token),或本地安装(pip/uvx)。核心功能包括图像生成、编辑、虚拟试衣等,并列出可用工具及使用示例。

Nano Banana MCP 对接指南

静觅 静觅 · 2026-08-06T06:01:09Z
驯服扩散Transformer中的异常标记

本文研究扩散Transformer(DiT)中的异常标记问题,发现其在编码器和去噪器中均存在,且简单掩蔽无效。提出双阶段寄存器(DSR)干预方法,通过训练或测试时寄存器及扩散寄存器,在ImageNet和文本到图像生成中减少异常伪影,提升生成质量,强调控制异常标记对构建更强DiT的重要性。

驯服扩散Transformer中的异常标记

Apple Machine Learning Research Apple Machine Learning Research · 2026-08-05T00:00:00Z
OpenCode 对接 Flux MCP

本文介绍如何在OpenCode中配置Flux MCP Server,以调用Flux图像生成与编辑模型。需先获取Ace Data Cloud API Token,并在opencode.json中设置远程MCP,注意关闭OAuth并启用Bearer鉴权。配置成功后可用自然语言生成或编辑图片,建议使用OpenAI系列模型以确保工具调用稳定。

OpenCode 对接 Flux MCP

静觅 静觅 · 2026-08-04T20:41:48Z
在线教程|4B参数实现生图+编辑,微软开源Mage-Flow,秒级图像推理至高支持2048分辨率

微软开源Mage-Flow,一款仅4B参数的紧凑图像生成模型,通过Tokenizer-Backbone-System设计,在图像生成和编辑上媲美20B-32B大模型,推理更快、显存更省。支持中英文文生图、指令编辑及Gradio交互,单张A100上1024×1024出图仅0.59秒,已在HyperAI上线供低成本体验。

在线教程|4B参数实现生图+编辑,微软开源Mage-Flow,秒级图像推理至高支持2048分辨率

HyperAI超神经 HyperAI超神经 · 2026-08-04T08:30:07Z

Google Earth新增Nano Banana 2图像生成功能,用户可基于真实卫星和3D影像输入文字生成定制图像。五种用途包括还原历史场景(如庞贝古城)、制作信息图、规划房地产项目、可视化建筑方案及创意改造地标。该功能已向全球网页版用户开放。

用Google Earth中的Nano Banana改造任何地方

The Keyword The Keyword · 2026-07-30T12:30:00Z
CVPR 2026 | PixelDiT:用于图像生成的像素扩散变换器

PixelDiT提出单阶段端到端像素空间扩散Transformer,无需VAE,采用补丁级和像素级双层架构,结合像素级AdaLN与Token压缩,高效建模全局语义和局部纹理。在ImageNet 256×256达1.61 FID,文生图GenEval 0.74,逼近潜空间模型,并避免VAE重建伪影,利于细节保留。

CVPR 2026 | PixelDiT:用于图像生成的像素扩散变换器

实时互动网 实时互动网 · 2026-07-30T07:20:10Z
Midjourney收购了占星应用Co-Star

Midjourney收购了占星应用Co-Star,其创始人Banu Guler将加入并担任首席设计官,同时继续负责该应用。此次收购旨在帮助Midjourney开发首批应用,包括图像生成应用。目前Midjourney的AI模型主要通过网页和Discord提供服务。

Midjourney收购了占星应用Co-Star

The Verge The Verge · 2026-07-24T19:06:58Z
给我看示例:从图像集合中推断视觉概念

本文介绍视觉概念推断任务(VICIS),要求模型从少量示例图像中提取共享概念,并应用于新查询图像生成。现有视觉语言模型在此任务上表现不佳,常忽略视觉上下文或产生偏见输出。作者提出训练框架和架构,学习从图像集合推断概念并提取查询特定嵌入。实验表明,该方法在合成数据和ImageNet/WordNet数据上生成更准确多样,且能泛化至未见概念和草图等模态。

给我看示例:从图像集合中推断视觉概念

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-17T00:00:00Z
Flux MCP 对接指南

Flux MCP 是 Anthropic 推出的模型上下文协议,允许 AI 模型通过标准化接口调用外部工具。用户可通过 AceData Cloud 的 Flux MCP Server 在多个 AI 客户端中生成和编辑图像。使用前需获取 API Token,并可选择托管或本地运行服务,支持文本生成图像和图像编辑功能,用户可通过自然语言调用这些功能。

Flux MCP 对接指南

静觅 静觅 · 2026-07-16T20:42:11Z
一层就足够:将预训练视觉编码器适应于图像生成

本文介绍了一种名为FAE(特征自编码器)的框架,旨在将预训练的视觉表示适应为适合图像生成的低维潜在空间。FAE通过单个注意力层和两个深度解码器的结合,实现了高效的图像生成,同时保持了必要的信息。该方法在多个基准测试中表现优异,展现了高质量和快速学习的能力。

一层就足够:将预训练视觉编码器适应于图像生成

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-15T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码