本文介绍如何将AceData Cloud提供的10个MCP Server(涵盖音乐、绘画、视频、搜索等)接入Google的Gemini CLI终端AI助手。文章详细说明了获取API Token、通过CLI命令或配置文件添加MCP的步骤,并提供了使用示例、计费方式及常见问题解答,帮助用户扩展Gemini CLI的多模态能力。
智谱发布GLM-5.3-Flash模型,价格低廉,支持多模态理解,并发率提升至50,速度快,性能可与Opus媲美。相比之下,DeepSeek涨价后优势减弱,作者对其兴趣下降。
智谱发布并开源GLM-5.3 Flash模型,即此前海外爆火的神秘模型“牛来”。该模型为320B参数、原生多模态,能力超越更大体量模型,在AA榜单获57分,价格仅为Claude Opus 4.8的1/40。实测中能精准配字幕、制作电影解说和还原设计稿。其采用混合注意力架构,运行于国产芯片,支持1M上下文,并已全面开源。
Z.ai的GLM-5.3-Flash模型(即Ox-alpha)以超低推理成本和高性能引发关注,性能接近Claude Opus 4.8和GPT-5.6 Terra,尤其在AI代理任务中表现优异。该模型支持多模态输入,基于中国AI芯片优化,推理成本远低于竞争对手,凸显中国开源模型在性能与成本上的竞争力。
STARFlow2提出统一多模态生成模型,结合冻结视觉语言模型与自回归归一化流,通过残差连接和统一因果掩码实现连续、单遍生成。它支持文本与图像交错输出,直接进入KV缓存,无需重编码,在图像生成和理解基准上表现优异,验证了自回归流作为统一多模态建模基础的可行性。
智象未来CEO梅涛在世界机器人大会论坛上演讲,提出高IQ不等于全能,强调世界模型对具身智能的重要性。公司发布原生全模态交互式世界模型HiDream-O1-World,支持多模态输入和长时程时空一致性,应用于AI影游、仿真和3D生成,并构建“数据—认知—行动—反馈”闭环飞轮,推动Physical AI商业化。
Muse-Glimmer-30B是Meta推出的300亿参数多模态智能体模型,支持本地运行,融合推理、工具调用和多模态理解,性能优异。文章还介绍了HyperAI平台更新的数据集、教程及社区内容,涵盖人物画像、车辆检测、分子处理、语音识别等AI资源。
DeepSeek发布多模态视觉理解模型V4-Flash-Vision-Exp,上线API平台,补齐视觉能力。该模型纯文本能力与V4-Flash持平,多模态Agent能力接近Opus-4.8,支持PPT生成、网站重构等场景。API按token计费,图片最多384 tokens,价格与V4-Flash一致,并推出免费Files API,降低开发者接入门槛。
Thinking Machines发布开源模型Inkling,采用混合专家架构,总参数9750亿,但每次推理仅激活约410亿参数。该模型结合滑动窗口与全局注意力层,支持百万级token上下文,并使用相对位置编码以避免外推问题。Inkling支持图像和音频输入,并引入可调推理努力参数,旨在便于用户定制和微调。
Qwen3.8-27B开源,拥有270亿参数,支持原生多模态和262K上下文,可扩展至100万Token。在SWE-bench Pro和QwenSWEBench上超越Claude Opus 4.6 Max,Agent和多模态评测表现优异。内置推理档位可调,支持关闭Thinking模式,默认开启preserve_thinking。量化后可在24GB显存显卡运行,支持Transformers、vLLM等部署。
Qwen3.8系列模型正式开源,所有开发者、科研机构和企业可免费下载、部署及商用。其中27B参数模型支持原生多模态和262K上下文,编程和办公性能大幅提升,新增推理控制功能。模型以Apache2.0协议开放,累计开源460余个模型,全球下载超30亿次。
OpenAI发布GPT-5.6 Luna,性能与DeepSeek V4相当,但速度快三倍,价格仅为后者的1/860,并支持多模态。Luna降价80%后免费开放给十亿用户,而DeepSeek计划涨价。文章认为,大模型竞争胜负取决于成本,而非智商,OpenAI正以价格优势重塑市场格局。
Google发布Gemini 3.7 Flash,半价促销至年底,四个月后价格翻倍。性能提升但迭代过快,疑为价格调整载体。竞争激烈,多模态有优势但API门槛高,开发者信任受损。此策略或为市场防御,但生命周期短于促销期,开发者应观望。
本文介绍Gemini Chat Completion API的申请与使用方法。需先在Ace Data Cloud控制台获取API Token,填写authorization、model和messages参数即可调用。支持多模态图片/视频输入、流式响应及多轮对话,并提供了Python、Java等代码示例及错误处理说明。
中科院团队提出GMC核心集剪枝方法,解决视觉语言模型Token冗余问题。该方法免训练,通过互补证据筛选和群体信息传输,保留关键视觉信息,减少80%以上Token,性能保持99%以上,并抑制幻觉,兼容Qwen、LLaVA等模型,提升推理速度,降低显存占用。
作者介绍了一种解决AI模型不支持多模态图片识别的方法:通过skill调用外部多模态模型API,将识别结果返回给当前会话模型。整个流程对用户无感,代码包含SKILL.md和analyze_image.py两个文件,兼容OpenAI和Anthropic格式,搭配阿里百炼qwen3.7-plus效果良好,并已开源在GitHub上。
本文回顾GPT系列发展:GPT-1确立Decoder-only预训练,GPT-2展现zero-shot潜力,GPT-3引入上下文学习,InstructGPT通过RLHF实现指令对齐,ChatGPT以对话形态普及,GPT-4迈向多模态。Decoder-only因训练简单、接口通用、扩展清晰而胜出,但存在推理延迟、长上下文成本、幻觉和对齐代价。
Read是Claude Code中感知外部世界的唯一合规通道,通过绝对路径读取文件内容,支持分页(默认2000行)、图片、PDF和Jupyter notebook等多模态输入。它建立行号坐标系,为Edit提供感知承诺,并强调按需读取、避免重复验证,是执行原语链条中承上启下的关键环节。
摩尔线程基于AI训推一体智算卡MTT S5000及MUSA软件栈,在MiniMax H3开源当日完成极速适配,仅用3小时打通推理路径。H3支持多模态输入,可生成2K视频,价格低至0.8元/秒,具备商用性价比。双方合作旨在加速多模态模型创新与AGI产业化落地。
本文系统研究了多模态大语言模型(MLLMs)中的偏好对齐问题,将算法分为离线(如DPO)和在线(在线DPO)两类,发现两者结合可提升性能。作者提出无需额外标注或外部模型的新型数据构建方法“偏差驱动幻觉采样”(BDHS),在多个基准上达到与现有对齐工作相当的竞争力,并分析了偏好数据集构建细节对模型表现的影响。
完成下面两步后,将自动完成登录并继续当前操作。