2026年10月初,一条消息在会计圈和AI圈同时刷屏:Anthropic 的 Claude Opus 5 在一项专业会计任务测评中拿到了20题全对、100%的成绩,而12名持证注册会计师(CPA)的得分
针对VLA模型缺乏物理理解、商业化受阻的问题,美梦空间发布Physical-WAM物理世界动作模型,通过物理Token表征实现感知、预测与动作修正,并推出RoboTwin-Phys物理漂移评测基准,以开源方式推动具身智能走向真实产业场景。
2026年9月,极海微电子两款激光打印SoC芯片KP3701与SN2701通过中国安全可靠测评,打印机主控芯片首次纳入“国测”。KP3701是国内首个量产的国产七核彩色多功能打印机SoC,SN2701为四核黑白激光打印SoC,均支持国密算法与多重安全防护。
兆芯开胜KH-50000服务器处理器通过国家级安全可靠Ⅱ级测评,获权威认证。该处理器面向数据中心、云计算及AI等场景自主研发,采用自主内核微架构与Chiplet互连架构,计算密度、I/O规格与安全性全面升级,并成为首个进入MLperf 3.0全球第一梯队的全国产AI存储方案。
莱卡云新加坡VPS测评:4核8G/1000Mbps配置,用8折码后152元/月,2核4G仅100元/月。硬件性能良好,带宽近千兆,三网平均延迟123ms,BGP直连回国,可解锁Netflix、ChatGPT等流媒体与AI服务,性价比高。
雨云德国法兰克福VPS测评:2核4G配置,100M带宽,联通优化,回程走AS9929精品线路,三网平均延迟163ms。流量可叠加,超量限速5M。性能均衡,流媒体解锁良好,支持7天退款。优惠后约35.28元/月。
AI生成3D模型实测对比OpenSCAD与CadQuery:两者成品均达3D打印标准,迭代次数相当,主要差距在出错模式。CadQuery报错显性、会中止运行,问题前置;OpenSCAD极少报错,隐性几何错误多,易输出报废零件。渲染预览无法发现致命缺陷,须靠体积、干涉等数值核验。简单结构选OpenSCAD,高精度组合件选CadQuery,成品还需独立网格检测。
雨云韩国首尔VPS测评:2核4G、40M带宽,优惠后月付32.48元。三网直连,原生/住宅IP可解锁TikTok、GPT等。实测AMD EPYC 7A23,Geekbench 7单核1449分,三网延迟均值65ms,回程走CN2/CMI直连,性价比高。
dsh-speech是DeepSeek Harness的语音插件,支持实时语音输入和AI回答的语音摘要,由AllModels.io提供技术。它区别于其他插件,将语音识别与摘要分离,用户可调整摘要详细度。安装简单,但需特定版本,且依赖付费服务,新用户获1美元额度。该插件旨在让打字成为可选项,提升交互效率。
AWS于2026年6月推出Lightsail香港数据中心,月费5美元,配置含2核CPU、512MB内存、20GB SSD及512GB流量。测评显示CPU和内存性能良好,但三网延迟一般,移动回程直连尚可,整体网络不如新加坡区。支持随时退款,适合建站,但香港流量仅为其他区一半。
维简W96Pro便携风扇拆解评测显示,其采用CH592F主控、SW6206双向快充芯片及HT7166升压芯片,配备4800mAh 21700电池,支持18W快充和C口输出。实测充电功率17.5W,最高转速4893RPM,电机功率12.52W。用料扎实,功能丰富,但最高档噪音大且立不稳,二挡续航约8小时。
蚂蚁国际发布自研时序AI预测大模型“鹰序TST”2.0版,在基准测试中取得最优成绩,预测准确率超93%。该模型专为跨境支付外汇风险管理设计,已获巴克莱、花旗等银行应用,并拓展至电商、航空等领域。文章还对比了Chronos-2、TimesFM等模型,强调金融场景需结合领域数据验证,通用榜单优势不等于稳定金融收益。
阿里开源Skill-Up评测工具,用于量化评估Agent Skill质量。它支持在Claude Code、Codex等真实环境中验证功能正确性,将失败用例转为修复指引,并支持本地与CI回归。工具提供命令行安装,可运行、筛选用例,生成多格式报告,并支持基线对比和迭代测试,帮助开发者标准化Skill评测流程。
该文揭露肽类药品灰色市场中的虚假测评网站,如Qingdao Sigma Chemical和CompoundTalk,它们用AI生成假好评和帖子,甚至伪造独立检测机构,专门吸引AI爬虫以污染训练数据。这种“AI吃自己呕吐物”的现象导致推荐结果误导消费者,警示AI数据污染风险日益严重。
本文从音视频、AI质检、合规存证等六个维度对比即构、菊风、佰锐、腾讯云四家智能双录厂商。即构在弱网与全球覆盖方面领先,菊风银行案例丰富,佰锐信创鸿蒙适配佳,腾讯云生态完善。选型需结合场景,建议试用后决策。
RealReplicaBench是阿里Accio Work团队推出的电商AI Agent评测基准,通过107个真实商业任务测试模型完成度,所有模型均未及格。它复刻真实工作环境,要求任务结果可被下一环节直接接手,用环境状态验证而非模型自述。该基准反映Agent时代评价标准从知识、推理转向实际完成任务的能力,也展示了团队对AI完成工作的深度理解。
本文测评了7款奇特避孕套,包括水润、延时、冰火、猫舌、夜光、颗粒指套和蘑菇入珠等类型。作者指出多数猎奇款体验一般,如冰套效果差、猫舌套无倒刺、夜光套气味刺鼻,仅水润和延时款较实用。最后提醒读者猎奇需谨慎,注意安全和伴侣沟通。
Riven Cloud新加坡Premium VPS测评显示,其采用Ryzen 9 9950X处理器,性能强劲,4K读写IOPS高达179K,网络速度优异。三网回程优化出色,电信CN2 GIA、联通9929、移动CMIN2,国内延迟多在100ms内。IPv4解锁TikTok、ChatGPT等,IPv6支持Disney+、Netflix。价格较高,但适合面向中国大陆用户的高性能需求场景。
酷鸭数据美国洛杉矶VPS测评:2核4G配置、7M带宽,三网直连延迟约173ms,电信走CN2、联通AS4837、移动CMIN2。性能中等,支持Netflix、ChatGPT等流媒体解锁,原生IPv4,月付37.5元,性价比高。
TÜV南德与中国汽研联合发布全域车用AI可信能力等级测评体系A-Trust,覆盖智能座舱、驾驶、车控、网联及车云协同等领域,首期试点智能座舱。该体系从准确性、鲁棒性、安全、透明度等维度综合评价,结合仿真、实验室、场地及实车测试,推动车用AI可信能力建设。
完成下面两步后,将自动完成登录并继续当前操作。