2026 09 19 HackerNews

💡 原文中文,约36800字,阅读约需88分钟。
📝

内容提要

本期Hacker News聚焦AI争议:微软高管称AI抓取是“史上最大劳动盗窃”,诉讼揭露OpenAI绕过付费墙抓取内容;OpenAI推出法律平台Astra for Law,法律搜索正确率提升40%;PrismML发布三元权重模型Bonsai 2,体积缩小9倍仍保留98.2%性能;Bend语言用形式化证明阻止AI引入bug;另有文章批评通行密钥对个人用户风险大,以及AI写作应仅作编辑而非枪手。

🔎

延伸解读

AI抓取争议:规模效应与法律滞后

诉讼文件披露微软高管私下称AI抓取是“人类历史上最大规模的劳动盗窃”,并揭示OpenAI和微软绕过付费墙抓取内容,导致《纽约时报》点击率下降高达93%。HN评论中,许多人强调人类学习与AI大规模抓取有本质区别,法律应考虑规模效应。有评论指出,版权是权衡,但规模变化会打破原有平衡,AI问题不能等事后反应。这反映出当前法律框架在应对AI训练数据问题时面临的根本性挑战。

通行密钥的便利与风险权衡

作者认为通行密钥虽能防钓鱼和服务器泄露,但对个人用户风险大于好处:硬件密钥无法备份且容量有限,同步通行密钥可能因账户被封而全部丢失,第三方密码管理器支持不完善。HN评论中,有人抱怨被频繁推送通行密钥,且恢复流程依赖邮件或短信,安全性未必提升。这提示我们,安全技术的推广需考虑用户实际体验和恢复机制,而非强制推行。

Bend语言:用形式化证明约束AI编程

Bend语言结合形式化证明与GPU并行,通过“法则”和“证明”机制让AI无法违反关键规则,从数学上阻止bug合并。其类型检查器速度极快,检查3200个泛型实例仅需0.38秒,适合AI即时验证。HN评论中,有人指出法律只能保护明确写出的部分,不是银弹,但一条简单法律可防止整类bug。这为AI辅助编程提供了一种新思路:通过形式化方法约束AI行为,而非仅依赖测试。

AI写作:辅助编辑而非替代创作

作者建议将LLM当作文案编辑而非枪手,自己完成初稿后让模型找出机械重复的问题,但绝不采用其具体措辞。HN评论中,多人反馈后编辑LLM文本耗时巨大,常变成“忒修斯之船”,最终自己重写更快。整体共识是,LLM可作为辅助工具,但面向人类的高质量写作仍需人类主导、大量编辑与事实把关,否则易产出无灵魂的公式化文本。

Q&A

微软高管为什么称AI抓取训练数据是“人类历史上最大规模的劳动盗窃”?

微软应用科学总监Brent Hecht在内部备忘录中写道,AI抓取训练数据是“规模惊人的盗窃行为”,并警告AI产品正在威胁出版商的生存。诉讼文件还显示,OpenAI和微软通过绕过付费墙、从Bing索引和Common Crawl大规模抓取内容,并刻意剥离版权信息。

OpenAI的Astra for Law在法律研究方面表现如何?

Astra for Law内置超过2.3亿URL的法律搜索索引,在Vals AI法律研究基准测试中整体正确率达到54.0%,比仅用网页搜索的GPT-6 Astra高出40%;在判例法问题上,参考案例检索量提升24%,相关段落检索量最高提升54%。

Bonsai 2 27B模型在压缩和性能上有什么特点?

Bonsai 2 27B采用三元权重(-1、0、+1)结合FP16分组缩放,实现每权重仅1.76比特的有效精度,总模型大小仅5.9GB,体积缩小9倍以上,同时保留98.2%的基准测试综合性能。它支持262K-token上下文窗口和多模态输入,采用Apache 2.0许可证。

Bend语言如何通过形式化证明阻止AI引入bug?

Bend通过“法则”(LAWS.bend)和“证明”(PROOF.bend)机制,让AI在编写代码时无法违反关键规则。其类型检查器本质上是证明检查器,检查3200个泛型实例仅需0.38秒,适合AI每次修改后即时验证。若没有法则保护,错误会被合并;有法则保护时,AI必须重试直到构建出满足证明的代码,使合并bug在数学上不可能。

为什么作者认为通行密钥对个人用户风险大于好处?

作者指出硬件密钥无法备份且存储容量有限(通常25-100个账户);苹果和谷歌的同步通行密钥可能因账户被封而全部丢失;第三方密码管理器支持不完善,体验碎片化;在他人设备上登录也不方便。因此建议个人用户使用随机密码加独立TOTP应用。

如何用LLM辅助写作而不让文章被“AI腔”污染?

作者建议把LLM当作文案编辑而非枪手:先自己完成初稿,再让模型找出机械重复、被动语态、动词名词化、用词重复、滥用虚词等问题。关键规则是绝不使用模型建议的任何具体措辞,并警惕模型的鼓励。LLM擅长机械、重复、耗神的编辑检查,但最终输出仍需人类主导。

🏷️

标签

➡️

继续阅读