SSI公司由伊利亚创办,估值320亿美元,将推出首个模型,采用测试时训练技术,让AI在推理中实时学习并更新权重,实现“边干边学”。该技术旨在提升样本效率,减少算力依赖,但面临安全挑战。若成功,将颠覆现有AI范式,使静态模型过时。
DeepSeek V4 Pro更新权重,现已在AI Gateway上默认使用,调用deepseek/deepseek-v4-pro无需改代码。新版本模型ID为deepseek/deepseek-v4-pro-0813,可通过AI SDK或编码代理配置使用。AI Gateway按提供商定价,无加价或平台费,支持BYOK。
OpenAI更新了ChatGPT中的GPT-5.6 Sol模型,优化日常聊天,但Work和Codex版本不变。新模型减少事实错误,Plus和Pro用户可调节思考深度。API未变,实际效果需测试验证。
Gemini Drops七月更新:macOS支持语音输入与编辑;Gemini Spark全球上线;推出3.6 Flash和3.5 Flash-Lite模型,推理更强速度更快;可添加个人头像生成个性化图像;集成Dropbox、Zillow Rentals和Viator等应用;美国用户可生成定制图像。
DeepSeek V4 Flash更新权重,代理能力显著增强,Terminal-Bench得分从56.9升至82.7。AI Gateway默认使用新权重,模型ID不变,代码无需修改。目前仅DeepSeek提供更新,其他供应商下周接入。用户可通过AI SDK设置模型,或在编码代理中配置使用。
AI Gateway更新了GPT-5.6系列模型价格与性能:Luna降价80%,Terra降价20%,Sol价格不变但快速模式提速至2.5倍。所有变更适用于长短上下文,模型ID不变,现有请求自动享受新费率与速度,无需代码修改。
VMAF v1 更新旨在解决旧版在视频质量评估中的系统性误差,特别是对低码率编码的敏感性。新模型考虑观看距离和终端场景,增强对非自然增强行为的敏感度,确保评分更符合观众实际感受。这次更新提升了模型的准确性,强调了视频质量评估的重要性,提醒行业关注用户体验。
ChatGPT的默认模型正在更新为更智能、更准确,提供更清晰、简洁的回答。新版本在医学、法律和金融等领域减少了52.5%的错误信息,并提升了日常任务的处理能力。GPT-5.5 Instant在个性化和上下文理解方面也有显著改进,用户体验更佳。此更新将逐步向所有用户推出。
本期播客讨论了最新的AI新闻,包括Anthropic的Opus 4.6、OpenAI的GPT-5.3 Codex和Google的Gemini 3 Deep Think等重大模型更新。此外,ByteDance的Seedance 2.0和新图像模型也备受关注。商业方面,ElevenLabs和Runway获得了巨额融资,Waymo准备量产其第六代硬件。
GPT 5.2今晨发布,更新了三个模型,提升了思考和推理能力,但速度较慢。用户反馈生成复杂任务需较长时间,编程能力有所提高。尽管在图像处理和网页设计上表现良好,但仍不及Gemini。整体来看,GPT 5.2的升级未能吸引用户回归。
作者将模型从sonnet 3.7更新至sonnet 4,但发现sonnet 4对主要提示和系统提示的理解较差,思维反应质量不如sonnet 3.7。询问是否有其他人遇到类似问题。
谷歌DeepMind发布了Gemini 2.5模型系列的更新,包括2.5 Pro和2.5 Flash。2.5 Pro在学术基准和编码领域表现优异,新增Deep Think推理模式,提升复杂数学和编码能力。2.5 Flash在效率和多模态处理上有所改善,新增原生音频输出和增强的安全性,旨在提升开发者体验和用户交互。
本研究提出开放世界图助手(OGA),旨在解决开放世界场景中的数据不确定性问题,特别是有限标记和未知类别节点的处理。OGA结合自适应标签追踪,将语义与拓扑相结合以拒绝未知类别,并通过图标签注释器实现模型更新。实验结果验证了OGA的有效性和实用性。
本文总结了2025年3月主要AI实验室(如OpenAI、Anthropic、DeepMind和Mistral)的最新研究动态和模型更新,帮助读者快速了解AI领域的进展。
本研究探讨了机器学习系统因数据集偏移导致的性能下降问题。模型更新的不透明性使用户难以理解其对系统推理的影响,带来了认识论和安全性挑战。虽然提出了一些替代策略,但每种策略都有其风险,未来需要进一步研究。
本研究提出RoLoRA框架,以提高联邦训练效率。通过交替优化微调LoRA适配器,RoLoRA在模型更新质量和表达能力上优于传统方法,尤其在多任务和大规模模型中表现突出。
OpenAI的“12天Shipmas”活动推出了多项新AI功能,包括o1推理模型、Sora视频生成、Canvas协作工具、与苹果智能的整合及ChatGPT搜索。用户反馈积极,但对模型更新的期待更高。
本研究提出了一种适应性数据中心框架,旨在解决自利代理在协作学习中的数据共享和模型更新问题。该框架通过仲裁者协调,处理实时数据的增量特性,优化代理的奖励和模型期望损失,实现高效的数据共享与模型定制。
本研究提出一种新方法,解决呼叫中心客户满意度调查响应率低的问题,能够准确复制反馈分布,提高满意度预测的准确性,并在模型更新时保持类别平衡。
本研究提出了BlackFed框架,旨在解决联邦学习在语义分割任务中的数据隐私问题。该框架结合零阶和一阶优化,实现安全的模型更新,既保护隐私又有效进行语义分割。
完成下面两步后,将自动完成登录并继续当前操作。