DeepSeek发布首个多模态实验模型V4-Flash-Vision-Exp,新增视觉理解能力,可处理图像图表等复杂任务,性能提升至36.5,多模态评测表现优异。HyperAI已上线部署教程,支持一键运行。
阿里通义千问发布Qwen3.8-Flash-Next,作为Qwen4架构预览,采用多模态MoE设计,通过混合注意力、门控残差和N-gram嵌入提升效率,主模型125B参数,激活仅6B,训练成本降至1/9,支持262K上下文,可扩展至百万Token,并已上线HyperAI教程供一键部署体验。
MiniMax H3是2026年8月发布的通用多模态视频生成模型,能理解文本、图像、视频和音频,根据描述生成最高2K分辨率、15秒时长、带立体声的视频。它支持文本生成、图像参考、视频编辑等多种方式,引入多项技术提升质量和效率,可应用于广告、电商、影视等领域。HyperAI平台已支持在线体验和部署。
MiniMax Music 3 是2026年8月开源的AI音乐生成模型,能根据文字描述和歌词,一次性完成作曲、编曲、演唱及完整歌曲制作,最长生成5分钟音乐。它采用多项先进技术,提升创作意图理解、长程一致性及音色真实感,支持多种风格和完整歌曲结构,适用于音乐制作、短视频配乐等领域,并提供在线教程供用户实践。
Qwen3.8-27B开源模型发布,拥有270亿参数,强化推理、编程与Agent能力,在代码、多模态和智能体评测中表现优异,接近顶级闭源模型。支持图像视频理解及灵活思考控制,HyperAI已上线教程供开发者快速调用。
DeepTutor是香港大学数据智能实验室开源的个人学习助手,整合问答、测验、研究、可视化、解题和掌握路径等多种模式于一个Agent工作空间,支持文档问答、个性化练习生成和深度研究。它集成多引擎RAG、网络搜索和代码执行,共享学习上下文,形成完整学习闭环。近期版本增强Agent工具、GraphRAG和模型支持,并已在HyperAI平台提供在线教程供开发者体验。
上海交大等机构发布蛋白质突变效应预测模型VenusREM,结合检索增强与结构感知语言模型,利用同源序列进化信息提升预测精度,在ProteinGym基准测试中排名第一。该模型支持序列和结构输入,可用于突变筛选、定向进化及致病性分析,并已上线HyperAI教程,便于实际应用。
微软开源Mage-Flow,一款仅4B参数的紧凑图像生成模型,通过Tokenizer-Backbone-System设计,在图像生成和编辑上媲美20B-32B大模型,推理更快、显存更省。支持中英文文生图、指令编辑及Gradio交互,单张A100上1024×1024出图仅0.59秒,已在HyperAI上线供低成本体验。
南北阁实验室发布Nanbeige4.2-3B模型,采用Looped Transformer架构,仅30亿参数,在Agent基准测试中表现优异,如SWE-Bench得分63.6,GPQA-Diamond得分87.4。支持Thinking Mode和262K上下文,已在HyperAI平台上线,便于开发者低成本探索本地智能体应用。
Prism ML团队发布Ternary-Bonsai-27B模型,基于Qwen3.6-27B架构,采用三进制量化将权重压缩至{-1,0,+1},体积从54GB降至7.2GB,性能保留95%。该模型支持262K上下文,峰值内存14.7GB,DSpark引擎提速1.34倍,已在HyperAI上线并支持一键部署,降低大模型使用门槛。
ComfyUI是开源的节点式可视化AI工作流框架,通过拖拽节点搭建图像和视频生成流程,无需编程,提升可控性和透明度。支持社区扩展、预设模板和模型自动检测,降低使用门槛。最新Wan 2.2视频模型已接入,HyperAI提供教程和在线运行资源,便于开发者部署和测试。
Empero 开源了 Qwythos-9B-Claude-Mythos-5-1M,这是一款增强推理能力的小模型,拥有 90 亿参数。该模型通过高质量数据提升复杂推理任务的表现,支持长上下文和工具调用,拓展了多模态应用。HyperAI 提供了快速部署和测试的资源,方便开发者使用。
InSpatio团队推出了InSpatio-World,这是一个实时4D世界模拟器,用户可以通过普通视频和自定义摄像机轨迹生成新视角视频。该模型采用时空自回归框架,支持复杂拍摄技巧,推理速度可达24 fps,适合实时应用。
阿里巴巴推出的「Qwen-AgentWorld-35B-A3B」模型在AgentWorldBench评测中超越Claude Sonnet 4.6。该模型专注于环境建模,具备跨领域建模能力,支持多种交互方式。其架构结合了Gated DeltaNet和Gated Attention,激活参数仅30亿,提升了效率和效果。该模型已上线HyperAI,用户可体验其智能体交互功能。
近年来,OCR 技术已从简单的文字识别发展为完整的文档理解。新一代 DeepSeek OCR 模型通过引入大语言模型,提升了识别准确率和复杂版面解析能力。百度的 Unlimited OCR 解决了传统 OCR 的效率低和上下文割裂问题,采用 R-SWA 机制,降低计算成本,支持长文档的高效处理,并可扩展至其他任务。
自2023年《3D Gaussian Splatting for Real-Time Rendering of Radiance Fields》发布以来,3DGS技术在三维重建领域迅速崛起。与传统NeRF相比,3DGS在渲染速度和视觉质量上有显著提升,但对显存和计算资源的要求较高。加州大学伯克利分校等机构开发的开源项目gsplat优化了训练框架,显著降低了资源需求,支持多种数据来源,并提供实时Web查看功能,便于快速验证模型。
香港科技大学(广州)团队提出的DVD模型通过一次前向传播实现视频深度估计,提升了推理效率,解决了几何幻觉问题。该模型在多个基准测试中表现优异,仅需36.7万帧训练数据,显著降低了成本,为视频三维感知提供了新技术路线。
Google于6月11日开源了基于离散扩散技术的文本生成模型DiffusionGemma。该模型具有高效的生成速度,能够以最高1100 Token/s的速度同时生成整个文本块,采用26B参数的混合专家设计,支持256K Token长上下文和多模态输入。尽管标准版Gemma 4在生成质量上更优,DiffusionGemma展示了新的发展方向。
Google DeepMind 发布了新款多模态模型 Gemma 4 12B,参数为120亿,但在多项测试中表现接近260亿参数的模型。其无编码器架构显著降低了推理延迟和内存占用,支持音频输入,并可在普通笔记本上运行,降低了部署成本,为开发者提供了接近顶级性能的选择。
NVIDIA 最近推出了视觉语言定位模型LocateAnything-3B,拥有30亿参数,支持多种视觉定位任务。其核心创新为并行框解码(PBD),显著提升了定位精度和解码速度,尤其在复杂场景下表现优异,推动了视觉定位技术的发展。
完成下面两步后,将自动完成登录并继续当前操作。