OpenAI推出Images 2.5图像生成模型,生成速度提升50%,改进透明背景和多轮编辑稳定性,能更好保留主体特征。API提供Flare和Sunburst两种模型,分别面向通用和精细编辑场景。目前每周生成图片超30亿张。
OpenAI发布ChatGPT Images 2.5,图像生成速度翻倍,每周产出超30亿张AI图片,引发对造假成本降低和“眼见为实”崩塌的担忧。新功能如草图生成和精准编辑降低门槛,但官方示例图存在缺陷,安全水印易被去除。技术虽中性,却可能导致视觉世界单调、记忆失真,使所有图像可信度下降。
Seedance是字节豆包系的视频生成模型,支持文生视频、图生视频、首尾帧及真人参考。通过Ace Data Cloud的API接口调用,需获取Token,首次有免费额度。支持异步任务,可轮询获取结果。2.0/2.5版本支持多模态参考和视频编辑,参数包括分辨率、比例、时长等。适用于短视频、电商展示和有声短片制作,真人参考功能尤其适合批量内容创作。
本文介绍Suno歌词生成API的对接方法。该API通过输入prompt(如“A song about winter”)自动生成歌词,支持default和remi-v1两种模型。返回结果包含多个候选歌词,每个含text(歌词内容)、title(标题)和tags(曲风标签)。生成歌词后,可配合Suno Audios Generation API进行自定义歌曲创作。
蚂蚁集团开源统一图像生成与编辑模型LLaDA-Image,含6B参数,提供Base和Turbo两版本,支持文生图、编辑及中英文渲染。Turbo采用蒸馏技术,仅需4步采样。模型在Qwen-Image-Bench上得分领先,并公开权重与推理代码。
影眸Hyper3D发布世界生成模型WorldGen,可将单张场景图在2-3分钟内生成可交互、可编辑的完整3D场景,每个资产独立且带物理属性。基于SIGGRAPH最佳论文CAST技术,WorldGen服务于具身智能、游戏、影视和XR领域,支持场景拆解、物理仿真及导入主流引擎,推动3D生成进入场景级时代。
Debian开发者勒戈尼代克因不满社区允许使用AI生成代码的政策而宣布退出。他主张完全禁止AI,但社区投票决定不鼓励也不禁止。勒戈尼代克认为中立立场等同于妥协,并指责AI公司支持右翼倾向。他已申请退休并获批准,未来可重新加入。此事反映AI对开源社区治理的影响。
作者发布Lottie插件0.1.0,核心非生成动画,而是实现可持续编辑:通过MotionProgram、MotionProject和MotionRuntime,让智能体在多轮修改中稳定引用对象、轨道和时间,结合CLI over MCP和Canvas反馈,使动画成为可演化的工程对象。
本文介绍Pixverse视频生成API的对接方法。用户需在Ace Data Cloud获取API Token,通过指定提示词、模型、清晰度、时长等参数生成视频。支持自定义首尾帧、模板特效、角色ID及视频扩展生成。API提供异步回调功能,任务完成后通过callback_url推送结果,并附有错误处理说明。
MiniMax H3是MiniMax推出的通用全模态生成模型,能同时处理文本、图片、视频和音频,并直接生成最高2K分辨率、24 FPS、15秒的视频。它统一了文生视频、图生视频、参考生视频和视频编辑等任务,采用音画联合生成机制,一次生成画面、语音、音效和音乐,强化了指令遵循和品牌渲染能力,适用于广告营销和多模态创作。
商汤大装置与智象未来合作,成功实现国产算力支持视频生成规模化应用。通过LightX2V多卡并行优化,加速比达93%,并解决多卡效果一致性问题。构建统一硬件抽象体系,支持10余种异构芯片零成本迁移,配合FDE专家服务,实现从适配到生产的完整闭环,推动国产算力从“能用”迈向“好用”。
千问办公首发上线Qwen3.8-Flash模型,推出标准模式,提升速度并降低Token消耗。新模型性能超越Claude Opus 4.6,经办公场景优化,单任务生成速度提升约100%,Token消耗减少75%。未来仅分标准和高级模式,95%日常任务用标准模式即可完成,打破性能、成本和速度的“不可能三角”。
阿里云发布视频生成模型Wan3.0,支持30秒视频生成及文档输入,价格按分辨率计费,并限时优惠。小米推出玄戒系列芯片,包括AI旗舰SoC、AI加速芯片和智驾芯片。惠普HyperX发布多款外设,HMD推出诺基亚功能机。另有科技简讯汇总。
AI Gateway新增异步视频生成功能,支持webhook回调、轮询、启动后查询及默认同步四种方式。用户可根据进程是否可等待或接收webhook选择方案。SDK已更新,支持文本转视频等输入,异步任务可在日志页监控,操作可序列化存储,便于后续查询。
该专利公开了一种利用大模型将产品想法自动生成PRD和用户故事的方法,通过特征列表和评估回路提升结构稳定性。它指出“想法转需求”是vibe coding的上游瓶颈,为独立开发者提供机会:可开发PRD生成工具或提供需求拆解服务,成本低、周期短,但需注意大模型升级带来的竞争风险。
LinkedIn推出“疑似AI生成”按钮后,已有超百万人使用。此举旨在应对平台上大量AI生成内容,并配合新分类器减少此类内容曝光。平台还新增提示,告知用户其帖子被标记为疑似AI,以提供反馈并鼓励减少AI使用。
DeepTutor是香港大学数据智能实验室开源的个人学习助手,整合问答、测验、研究、可视化、解题和掌握路径等多种模式于一个Agent工作空间,支持文档问答、个性化练习生成和深度研究。它集成多引擎RAG、网络搜索和代码执行,共享学习上下文,形成完整学习闭环。近期版本增强Agent工具、GraphRAG和模型支持,并已在HyperAI平台提供在线教程供开发者体验。
本文介绍2019年Song与Ermon提出的基于分数的生成建模框架。该方法不直接学习数据分布,而是学习其分数(对数密度梯度),通过分数匹配训练噪声条件分数网络(NCSN),并用退火朗之万动力学从噪声中采样。多级高斯噪声扰动解决了流形假设和低密度区域问题,在CIFAR-10上取得先进结果,为现代扩散模型奠定基础。
微软上调Windows 11 OEM授权费,平均涨幅7%-10%,7月生效,加剧硬件成本压力,部分成本转嫁消费者。小米发布REDMI K100 Pro系列,搭载骁龙8至尊版,起售价3999元。Claude将按欧盟AI法案为生成内容添加隐水印。雷蛇发布那伽梵蛇V3专业版鼠标,售价1499元。
ω-0是一种用于人形机器人并行行走与操作的世界动作模型,通过潜在预测而非视频生成来学习全身协同控制。它联合训练未来视觉潜变量与全身动作潜变量,避免依赖大型视频生成器。模型利用人类数据预训练,并构建ω-HOME数据集,在11个家庭任务上实现统一模型控制,展现平滑的全身协调能力。
完成下面两步后,将自动完成登录并继续当前操作。