➡️
继续阅读
-
使用Gemini中的Lyria 3.5,创作你迄今最出色的音乐作品。
谷歌发布音乐生成模型Lyria 3.5,现已在Gemini应用和API中提供。该模型增强人声表现力和编曲丰富度,支持用户选择风格、人声或器乐,使用模板快速...
-
SenseNova-U1.5-8B-MoT 统一生成与理解,解锁原生多模态创作;DeepSeek-V4-Flash-Vision-Exp 拓展视觉理解新能力
商汤科技发布SenseNova-U1.5-8B-MoT统一多模态模型,支持图像生成、编辑与理解,提升4K画质和文字渲染。HyperAI官网更新数据集、教程...
-
苹果提前「揭晓」触屏 MacBook Pro,我终于能戳同事电脑了
苹果正在研发首款OLED触屏MacBook,预计2025年10月发布,搭载M5芯片并采用灵动岛设计。macOS 27将加入触控支持,区分直接与间接触控,并...
-
把Agent放进真实尺度香港,上交大/新加坡国立大学/美团等提出UrbanGround,测试多模态模型城市探索能力
该文章介绍了一项关于多模态大语言模型(MLLM)在城市导航中能力的研究。研究团队构建了基于香港真实地理数据的URBANGROUND交互环境,评测了GPT-...
-
AI原生工程实践:AI工程师与前沿部署工程师如何利用Claude Code、Codex和Gemini进行开发
本文介绍AI原生软件开发生命周期(SDLC)框架,涵盖计划、设计、构建、测试、部署、维护六阶段。核心是通过意图、规格、计划等文档驱动开发,将瓶颈从编码转向...
-
DeepSeek-V4 模型结构(6):优化器与稳定性,Muon
DeepSeek-V4采用Muon优化器,通过谱范数最速下降实现逐矩阵正交化,用Newton-Schulz迭代逼近SVD,混合系数提升小奇异值并精确稳定大...