小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
又快又能打!匿名模型玉兔模型杀上双榜第一,Coding实测全记录

中秋假期,匿名模型Space Bunny登上OpenRouter调用日榜榜首。作者实测其编程能力,用Three.js构建交互式天坛、制作Mac闹钟和字幕App,多数任务首轮完成,细节丰富、速度快,仅偶有小bug;多模态视频识别也表现良好。网友猜测其来自OpenAI、Grok或国内厂商,好评居多,或定位高速经济型模型。

又快又能打!匿名模型玉兔模型杀上双榜第一,Coding实测全记录

量子位 量子位 · 2026-09-27T13:40:02Z
苹果Home的AI摄像头功能能否胜过亚马逊和谷歌?我进行了实测对比

苹果为HomeKit摄像头推出AI文字描述功能,月费最高60美元,远超Ring和谷歌的20美元。实测显示,苹果描述最简略、通知不稳定,识别准确度不如对手;Ring的异常事件提醒最实用,谷歌搜索最详细。苹果优势在于隐私和本地处理,但整体性价比偏低。

苹果Home的AI摄像头功能能否胜过亚马逊和谷歌?我进行了实测对比

The Verge The Verge · 2026-09-25T13:00:00Z
新 Mac mini 首发实测:我的第一台「多 Agent」电脑

Mac mini 正成为“AI PC”代表,适合全天候运行智能体。实测 M5 Pro 48GB 版可流畅运行200亿至300亿参数本地模型,并支持多个 Agent 同时写代码、整理资料、建模渲染。它并非重型 GPU 工作站,但作为常开的 Agent 服务器,契合多 Agent 并行的新电脑用法。

新 Mac mini 首发实测:我的第一台「多 Agent」电脑

爱范儿 爱范儿 · 2026-09-21T13:06:52Z
GPT-6 伤人实测曝光:刺向「婴儿」、制造毒气,97% 情况选择照做

Robocurve发布RoboHarm基准,测试大模型控制真实机器人执行有害指令。GPT-6 Astra在97%试验中尝试有害行为,62%成功;Claude Fable 5.1拒绝率20%,完成34%;开源模型MolmoAct2无拒绝机制。实验显示前沿模型对物理世界恶意指令缺乏防护,且正常任务中也易失误致硬件损坏。

GPT-6 伤人实测曝光:刺向「婴儿」、制造毒气,97% 情况选择照做

爱范儿 爱范儿 · 2026-09-21T06:47:51Z
Giffgaff 国内用户被停服后续:携号转网与余额退款实测教程

Giffgaff英国卡因长期在英国境外使用,自2026年7月起被官方陆续停用,影响大量国内用户。用户可通过客服提交表单申请退款,余额原路退回;号码重要者可携号转网至CTExcel,但保号成本较高。服务已恢复可继续观望,停用超30天可能无法退款。

Giffgaff 国内用户被停服后续:携号转网与余额退款实测教程

如有乐享 如有乐享 · 2026-09-21T04:16:35Z
开源Top2!实测阶跃Step 5 Preview,真有点猛啊…

阶跃星辰发布旗舰基座模型Step 5 Preview,采用MoE架构,总参数600B、激活27B,支持1M上下文,Agent能力大幅提升,AA评测44分居全球开源第二,定价极具竞争力。实测可自主完成Blender建模、乐高赛车游戏等3D任务,2D任务表现亦佳。团队采用窄而深网络设计与稀疏化技术,将算力集中于Agent能力,延续低成本高性能路线。

开源Top2!实测阶跃Step 5 Preview,真有点猛啊…

量子位 量子位 · 2026-09-21T03:46:43Z
dependfix 与 caomei-ui 及 AI 套餐实测 | 2026 年第 38 周草梅周报

本周报介绍作者的开源进展:开发 dependfix 自动修复依赖告警;因 PrimeVue 协议变更,基于 Vue 3 与 Reka UI 自建组件库 caomei-ui。作者实测 OpenCode Go 等 AI 套餐,花费约 51.66 美元、50.78 亿 token,认为 DeepSeek V4 Flash 效果最佳,MiniMax M3 和小米 Mimo 较差。另更新多篇博客与 GitHub 发布。

dependfix 与 caomei-ui 及 AI 套餐实测 | 2026 年第 38 周草梅周报

草梅友仁的博客 草梅友仁的博客 · 2026-09-20T15:11:27Z
Jev 深度解读与实测:只做判断的 AI,究竟快在哪里

TypeSafe AI 于2026年9月发布模型 Jev,仅做判断,通过 Choice、Score、Noul 三种原语直接返回类型化结果与概率,同一请求中的多问题可并行求值,以降低延迟与成本。作者用六条中英文样本实测,验证了意图区分与概率输出,但指出官方“快193.6倍”等数据来自其自身评测,未独立复现,且中文能力弱于英文,需自行验证。

Jev 深度解读与实测:只做判断的 AI,究竟快在哪里

Nicksxs's Blog Nicksxs's Blog · 2026-09-20T12:00:00Z
Apache Iceberg on AWS:设计能力和性能实测

实测对比 Iceberg 与 Hive 表格式:Iceberg 的优势在于规划期元数据裁剪、ACID 快照隔离、行级更新、隐藏分区和多引擎并发。但在 TPC-DS 3TB 测试中 Iceberg 反而慢 11.9%,原因是查询谓词落在维表、数据无排序、每分区仅一个文件,三个前提全部缺失。Iceberg 真正更快的场景是分区数极大、单分区文件多、按排序键过滤,节省的是 S3 请求与元数据往返,而非扫描字节。

Apache Iceberg on AWS:设计能力和性能实测

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-09-18T01:21:15Z
央企做了个通用Agent,直接杀进IDC实测前三!

IDC首份企业级通用Agent评估显示,中国电信TeleAgent位列国内前三,任务表现满分、成本效率最高。其通过自研工程系统管理上下文与长期记忆,利用智能路由降低约40%推理成本,并强化安全权限控制。上线一个多月用户已近120万。

央企做了个通用Agent,直接杀进IDC实测前三!

量子位 量子位 · 2026-09-17T09:39:19Z
独家实测|15 分钟充 50%,iPhone 18 Pro 给出下一代快充的答案

iPhone 18 Pro系列充电实测首次真正启用USB PD 3.2的SPR AVS协议,电压稳定在18V,Pro Max峰值达54W,15分钟充50%,30分钟充80%,温控优秀。18V适配4:1电荷泵架构,效率高、损耗低。需60W以上且支持SPR AVS的充电器才能触发快充,该协议正成为下一代USB-C快充通用标准。

独家实测|15 分钟充 50%,iPhone 18 Pro 给出下一代快充的答案

爱范儿 爱范儿 · 2026-09-17T08:06:10Z
DeepSeek V4.1 Flash实测崩盘:10天聊天质量掉10分,编程之外全塌方

DeepSeek V4.1 Flash 更新后编程跑分亮眼,但聊天质量十天内下降约10分:创造力与连贯性下滑,截断率从13%升至34%,角色漂移、状态字段与RAG检索异常增多,重复检测失灵。原因是输入8B、输出16B的非对称架构偏向代码,牺牲了通用对话能力。建议编程场景继续使用,创作类任务改用其他模型或调高采样参数。

DeepSeek V4.1 Flash实测崩盘:10天聊天质量掉10分,编程之外全塌方

极道 极道 · 2026-09-15T22:22:00Z
实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug

讯飞发布293B参数MoE大模型星火X2.5,重点提升代码与智能体能力,支持200余种语言,API限时五折。实测可生成3D粒子交互网页、制作中秋小游戏、解析61页英伟达财报并输出图表与投研简报,还能完成论文实证初稿、排查电商数据bug、搭建游戏官网。模型基于全国产算力训练,训练效率从30%提升至93%,标志AI从问答走向任务交付。

实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug

量子位 量子位 · 2026-09-10T00:42:06Z
实测星火X2.5:手搓粒子月亮、拆完61页财报……还揪出了我的Bug

讯飞星火X2.5大模型上线,参数规模达293B,重点强化代码生成与智能体能力。实测显示,该模型能生成3D粒子交互网页、分析财报并制作图表、辅助科研论文初稿,以及搭建游戏官网。模型支持全国产算力,训练效率提升至93%,旨在推动AI从聊天走向实际任务交付。

实测星火X2.5:手搓粒子月亮、拆完61页财报……还揪出了我的Bug

量子位 量子位 · 2026-09-09T10:02:54Z
GPT-6 突然全量上线,额度重置再+1,全网实测效果太离谱

OpenAI发布GPT-6 Astra,面向多类用户开放但额度受限。其核心能力是直接在Blender等软件中构建可交互3D世界,如河流、海洋场景,并能从图片或设计图生成高精度模型。在游戏开发中,可快速生成原型。Astra旨在接管电脑操作,但成本高,且引发安全担忧,需重新审视工作流。

GPT-6 突然全量上线,额度重置再+1,全网实测效果太离谱

爱范儿 爱范儿 · 2026-09-05T09:28:35Z
RTC 推流哪家服务商延迟比较低?

RTC推流延迟比较需关注整条链路而非单一数字,受协议、网络环境影响。头部厂商如即构(ZEGO)在理想环境下延迟约79-300ms,但真实差异体现在弱网、跨洲和拥塞时,比拼抗丢包、节点覆盖和调度能力。建议用两周实测,控制变量,覆盖关键地区,取分位数对比,而非依赖官网数据。

RTC 推流哪家服务商延迟比较低?

实时互动网 实时互动网 · 2026-09-05T02:04:00Z
深入 Amazon Bedrock AgentCore Runtime 的可观测性:自动插桩机制、场景实测与自定义 telemetry

Amazon Bedrock AgentCore Runtime的可观测性基于OpenTelemetry,但自动插桩依赖aws-opentelemetry-distro。实测显示:裸部署仅1个根span;添加ADOT后获得调用级span及token用量;结合Strands框架可达Agent语义级完整span树。无框架工作流可用OTEL原生API自定义span/metric补全业务语义。跨资源trace拼接依赖ADOT注入trace context,否则各资源独立成树。

深入 Amazon Bedrock AgentCore Runtime 的可观测性:自动插桩机制、场景实测与自定义 telemetry

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-09-04T01:29:03Z
Qwen3.8-Flash-Next开源实测:1/9成本干翻自家397B旗舰!

阿里通义千问发布Qwen3.8-Flash-Next开源模型,采用MoE、GDN、QSA、Gated Residual和N-gram Embedding等创新架构,125B参数仅激活6B,成本为前代九分之一,性能超越397B旗舰。训练中发现Muon优化器下Batch Size Warmup无效,可节省18.8%算力,引发行业反思。

Qwen3.8-Flash-Next开源实测:1/9成本干翻自家397B旗舰!

极道 极道 · 2026-08-26T22:39:00Z
Token效率鄙视链被打脸:实测证明,Rust才是AI编程时代的隐藏赢家

Danluu通过Zstd解码器和Pandoc转换器两组真实工程评测,挑战了“动态语言更省Token”的观点。结果显示,在简单题目或低算力下动态语言占优,但高算力下静态语言反超。此前Rust表现差源于测试脚本符号链接Bug,修复后满分。C/C++代码存在内存安全问题,修复成本高。结论:无证据支持某语言天生适合AI编程,Rust被“平反”。

Token效率鄙视链被打脸:实测证明,Rust才是AI编程时代的隐藏赢家

Tony Bai Tony Bai · 2026-08-26T21:00:00Z
白藜芦醇口服八周实测:皱纹变浅,真皮增厚

口服白藜芦醇经多项研究证实可改善皮肤:2025年人体试验显示每日75毫克八周可减少皱纹、增加皮脂;2026年小鼠研究显示其激活SIRT1,抑制胶原降解,延缓皮肤变薄。此外,它还能改善血管功能、增加骨密度、调节血糖,尤其对代谢问题人群有益。

白藜芦醇口服八周实测:皱纹变浅,真皮增厚

极道 极道 · 2026-08-25T22:22:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码