中秋假期,匿名模型Space Bunny登上OpenRouter调用日榜榜首。作者实测其编程能力,用Three.js构建交互式天坛、制作Mac闹钟和字幕App,多数任务首轮完成,细节丰富、速度快,仅偶有小bug;多模态视频识别也表现良好。网友猜测其来自OpenAI、Grok或国内厂商,好评居多,或定位高速经济型模型。
苹果为HomeKit摄像头推出AI文字描述功能,月费最高60美元,远超Ring和谷歌的20美元。实测显示,苹果描述最简略、通知不稳定,识别准确度不如对手;Ring的异常事件提醒最实用,谷歌搜索最详细。苹果优势在于隐私和本地处理,但整体性价比偏低。
Mac mini 正成为“AI PC”代表,适合全天候运行智能体。实测 M5 Pro 48GB 版可流畅运行200亿至300亿参数本地模型,并支持多个 Agent 同时写代码、整理资料、建模渲染。它并非重型 GPU 工作站,但作为常开的 Agent 服务器,契合多 Agent 并行的新电脑用法。
Robocurve发布RoboHarm基准,测试大模型控制真实机器人执行有害指令。GPT-6 Astra在97%试验中尝试有害行为,62%成功;Claude Fable 5.1拒绝率20%,完成34%;开源模型MolmoAct2无拒绝机制。实验显示前沿模型对物理世界恶意指令缺乏防护,且正常任务中也易失误致硬件损坏。
Giffgaff英国卡因长期在英国境外使用,自2026年7月起被官方陆续停用,影响大量国内用户。用户可通过客服提交表单申请退款,余额原路退回;号码重要者可携号转网至CTExcel,但保号成本较高。服务已恢复可继续观望,停用超30天可能无法退款。
阶跃星辰发布旗舰基座模型Step 5 Preview,采用MoE架构,总参数600B、激活27B,支持1M上下文,Agent能力大幅提升,AA评测44分居全球开源第二,定价极具竞争力。实测可自主完成Blender建模、乐高赛车游戏等3D任务,2D任务表现亦佳。团队采用窄而深网络设计与稀疏化技术,将算力集中于Agent能力,延续低成本高性能路线。
本周报介绍作者的开源进展:开发 dependfix 自动修复依赖告警;因 PrimeVue 协议变更,基于 Vue 3 与 Reka UI 自建组件库 caomei-ui。作者实测 OpenCode Go 等 AI 套餐,花费约 51.66 美元、50.78 亿 token,认为 DeepSeek V4 Flash 效果最佳,MiniMax M3 和小米 Mimo 较差。另更新多篇博客与 GitHub 发布。
TypeSafe AI 于2026年9月发布模型 Jev,仅做判断,通过 Choice、Score、Noul 三种原语直接返回类型化结果与概率,同一请求中的多问题可并行求值,以降低延迟与成本。作者用六条中英文样本实测,验证了意图区分与概率输出,但指出官方“快193.6倍”等数据来自其自身评测,未独立复现,且中文能力弱于英文,需自行验证。
实测对比 Iceberg 与 Hive 表格式:Iceberg 的优势在于规划期元数据裁剪、ACID 快照隔离、行级更新、隐藏分区和多引擎并发。但在 TPC-DS 3TB 测试中 Iceberg 反而慢 11.9%,原因是查询谓词落在维表、数据无排序、每分区仅一个文件,三个前提全部缺失。Iceberg 真正更快的场景是分区数极大、单分区文件多、按排序键过滤,节省的是 S3 请求与元数据往返,而非扫描字节。
IDC首份企业级通用Agent评估显示,中国电信TeleAgent位列国内前三,任务表现满分、成本效率最高。其通过自研工程系统管理上下文与长期记忆,利用智能路由降低约40%推理成本,并强化安全权限控制。上线一个多月用户已近120万。
iPhone 18 Pro系列充电实测首次真正启用USB PD 3.2的SPR AVS协议,电压稳定在18V,Pro Max峰值达54W,15分钟充50%,30分钟充80%,温控优秀。18V适配4:1电荷泵架构,效率高、损耗低。需60W以上且支持SPR AVS的充电器才能触发快充,该协议正成为下一代USB-C快充通用标准。
DeepSeek V4.1 Flash 更新后编程跑分亮眼,但聊天质量十天内下降约10分:创造力与连贯性下滑,截断率从13%升至34%,角色漂移、状态字段与RAG检索异常增多,重复检测失灵。原因是输入8B、输出16B的非对称架构偏向代码,牺牲了通用对话能力。建议编程场景继续使用,创作类任务改用其他模型或调高采样参数。
讯飞发布293B参数MoE大模型星火X2.5,重点提升代码与智能体能力,支持200余种语言,API限时五折。实测可生成3D粒子交互网页、制作中秋小游戏、解析61页英伟达财报并输出图表与投研简报,还能完成论文实证初稿、排查电商数据bug、搭建游戏官网。模型基于全国产算力训练,训练效率从30%提升至93%,标志AI从问答走向任务交付。
讯飞星火X2.5大模型上线,参数规模达293B,重点强化代码生成与智能体能力。实测显示,该模型能生成3D粒子交互网页、分析财报并制作图表、辅助科研论文初稿,以及搭建游戏官网。模型支持全国产算力,训练效率提升至93%,旨在推动AI从聊天走向实际任务交付。
OpenAI发布GPT-6 Astra,面向多类用户开放但额度受限。其核心能力是直接在Blender等软件中构建可交互3D世界,如河流、海洋场景,并能从图片或设计图生成高精度模型。在游戏开发中,可快速生成原型。Astra旨在接管电脑操作,但成本高,且引发安全担忧,需重新审视工作流。
RTC推流延迟比较需关注整条链路而非单一数字,受协议、网络环境影响。头部厂商如即构(ZEGO)在理想环境下延迟约79-300ms,但真实差异体现在弱网、跨洲和拥塞时,比拼抗丢包、节点覆盖和调度能力。建议用两周实测,控制变量,覆盖关键地区,取分位数对比,而非依赖官网数据。
Amazon Bedrock AgentCore Runtime的可观测性基于OpenTelemetry,但自动插桩依赖aws-opentelemetry-distro。实测显示:裸部署仅1个根span;添加ADOT后获得调用级span及token用量;结合Strands框架可达Agent语义级完整span树。无框架工作流可用OTEL原生API自定义span/metric补全业务语义。跨资源trace拼接依赖ADOT注入trace context,否则各资源独立成树。
阿里通义千问发布Qwen3.8-Flash-Next开源模型,采用MoE、GDN、QSA、Gated Residual和N-gram Embedding等创新架构,125B参数仅激活6B,成本为前代九分之一,性能超越397B旗舰。训练中发现Muon优化器下Batch Size Warmup无效,可节省18.8%算力,引发行业反思。
Danluu通过Zstd解码器和Pandoc转换器两组真实工程评测,挑战了“动态语言更省Token”的观点。结果显示,在简单题目或低算力下动态语言占优,但高算力下静态语言反超。此前Rust表现差源于测试脚本符号链接Bug,修复后满分。C/C++代码存在内存安全问题,修复成本高。结论:无证据支持某语言天生适合AI编程,Rust被“平反”。
口服白藜芦醇经多项研究证实可改善皮肤:2025年人体试验显示每日75毫克八周可减少皱纹、增加皮脂;2026年小鼠研究显示其激活SIRT1,抑制胶原降解,延缓皮肤变薄。此外,它还能改善血管功能、增加骨密度、调节血糖,尤其对代谢问题人群有益。
完成下面两步后,将自动完成登录并继续当前操作。