小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Typecho Admin Night Mode Plugin: DarkMode

该文章介绍Anubis,一种用于保护网站免受AI公司大规模数据抓取的解决方案。它采用类似Hashcash的工作量证明机制,增加抓取成本,同时不影响普通用户。Anubis是临时措施,未来将改进浏览器指纹识别技术,以区分真实用户和自动化程序。

Typecho Admin Night Mode Plugin: DarkMode

初之音 初之音 · 2026-08-08T18:01:00Z
PandaBangumi for Typecho 更新!

该文章介绍Anubis,一种用于保护网站免受AI公司大规模数据抓取的解决方案。它采用类似Hashcash的工作量证明机制,使批量抓取成本高昂,同时尽量不影响普通用户。目前仍需启用JavaScript,未来计划通过指纹识别无头浏览器来优化。

PandaBangumi for Typecho 更新!

初之音 初之音 · 2026-08-06T07:06:00Z
Jinhua Diary

该文章介绍Anubis,一种用于保护网站免受AI公司大规模数据抓取的解决方案。它采用类似Hashcash的工作量证明机制,增加抓取成本,同时不影响普通用户。文章指出,这是临时措施,未来将改进浏览器指纹识别技术,以更好区分真实用户和自动化程序。

Jinhua Diary

初之音 初之音 · 2026-07-31T02:45:00Z
数据增长的隐形助推器:ADSL 轮换代理,把被风控变成被允许(含实战示例)

ADSL轮换代理服务提供真实拨号线路的海量出口IP,降低风控风险,适用于舆情监测和价格比对等场景。使用简单,按量计费,支持多种协议,帮助用户稳定数据抓取。

数据增长的隐形助推器:ADSL 轮换代理,把被风控变成被允许(含实战示例)

静觅 静觅 · 2026-07-14T20:36:12Z
一款基于.NET开源的爬虫库,小白也能直接上手,简单、全能,高效

这是一款基于.NET的开源爬虫库,简化了数据抓取过程,适配多个主流平台,支持动态模型抓取和RESTful接口,具备多种缓存策略和代理池功能,降低IP封禁风险,使用简单,学习成本低,适合快速集成和数据分析。

一款基于.NET开源的爬虫库,小白也能直接上手,简单、全能,高效

dotNET跨平台 dotNET跨平台 · 2026-05-08T00:02:16Z

Hacker News 上分享的老文章标题末尾会标注年份。本站收集了得分≥4的文章,覆盖1900–2025年,并附上中文翻译。数据通过 Algolia HN Search API 抓取,项目基于 jsomers/hacker-classics 更新。

从 1900 年开始按年阅读 Hacker News 的文章

Owen的博客 Owen的博客 · 2026-05-05T19:58:54Z
AI抵制浪潮兴起:数据投毒与虚假信息如何反击模型训练

人们通过投喂垃圾数据和散布虚假信息来抵制AI数据抓取,旨在提高数据采集成本,迫使科技公司改变做法。Reddit社区“毒泉”鼓励用户向爬虫提供无用数据,以影响AI模型训练。这被视为和平反抗,旨在保护网络内容创作者的权益,促使AI公司重新思考数据获取方式。

AI抵制浪潮兴起:数据投毒与虚假信息如何反击模型训练

极道 极道 · 2026-04-21T00:47:00Z
传统抓取与AI抓取:开发者和数据团队的实用指南

网络数据生成量巨大,开发者面临可靠抓取的问题。传统抓取依赖选择器提取数据,但结构变化会导致失败。AI抓取通过理解内容而非结构提取数据,适应性更强。两者各有优劣,结合使用更为有效。

传统抓取与AI抓取:开发者和数据团队的实用指南

freeCodeCamp.org freeCodeCamp.org · 2026-04-16T21:37:47Z
本地Qwen+云模型:OpenClaw真实体验

OpenClaw近期受到关注,吸引用户尝试,但功能被认为有限。作者分享了两个实用场景:自动化博客发布和定时数据抓取工具。国产模型在复杂任务上与Claude存在差距,但在简单任务中表现稳定。本地部署适合轻量任务,满足隐私需求。

本地Qwen+云模型:OpenClaw真实体验

远飞闲记 远飞闲记 · 2026-03-09T00:00:00Z
本地Qwen+云模型:OpenClaw真实体验

OpenClaw近期受到关注,但用户普遍认为其功能有限,主要用于日常对话。尽管有人声称通过安装订单获利,但多为宣传。作者分享了两个实用场景:自动化博客发布和定时数据抓取工具。国产模型与Claude在复杂任务上仍有差距,但在简单任务中表现良好。本地部署适合轻量任务,满足隐私需求。

本地Qwen+云模型:OpenClaw真实体验

远飞闲记 远飞闲记 · 2026-03-09T00:00:00Z
2026年大型数据抓取的最佳代理服务提供商

文章比较了四大代理服务提供商:Bright Data、Oxylabs、Infatica和NetNut,指出Bright Data在全球覆盖、合规性和反机器人技术方面的优势,适合高需求的企业级数据抓取。

2026年大型数据抓取的最佳代理服务提供商

KDnuggets KDnuggets · 2025-12-04T18:00:19Z
网络论坛REDDIT宣布起诉AI公司Perplexity等未经授权抓取数据训练人工智能模型

Reddit 起诉 Perplexity 等公司未经授权抓取数据,指控其非法使用论坛内容。Perplexity 声称未使用 Reddit 数据,但其机器人仍引用 Reddit 内容。Reddit 强调数据价值,要求停止抓取。

网络论坛REDDIT宣布起诉AI公司Perplexity等未经授权抓取数据训练人工智能模型

蓝点网 蓝点网 · 2025-10-23T02:23:21Z
Reddit起诉Perplexity,指控其非法获取内容以供人工智能使用

Reddit起诉Perplexity及三家数据抓取服务商,指控其非法获取Reddit数据,称其行为如同“银行抢劫犯”。Perplexity则表示将为用户的知识获取权利而战。

Reddit起诉Perplexity,指控其非法获取内容以供人工智能使用

The Verge The Verge · 2025-10-22T17:38:24Z
如何使用Firecrawl将网站转化为适合大型语言模型的数据

Firecrawl是一个开源API工具,能够快速将网站内容转化为结构化数据,便于大型语言模型使用。它支持复杂网站的数据抓取,自动处理代理和反机器人系统。用户只需提供网址,即可获取干净的Markdown、HTML或JSON格式数据,简化数据收集过程。Firecrawl适合开发者和数据科学家进行模型训练、情感分析和网站内容监控。

如何使用Firecrawl将网站转化为适合大型语言模型的数据

freeCodeCamp.org freeCodeCamp.org · 2025-10-22T16:02:51Z
通过Cloudflare的新内容信号政策赋予用户选择权

Cloudflare推出内容信号政策,允许网站运营者在robots.txt中表达对内容使用的偏好,以保护内容创作者的权益,解决数据抓取问题,增强创作者对数据使用的控制。

通过Cloudflare的新内容信号政策赋予用户选择权

The Cloudflare Blog The Cloudflare Blog · 2025-09-24T13:10:00Z

Puppeteer - Sharp是基于Google Puppeteer的.NET封装,旨在高效控制Chrome浏览器。其主要功能包括页面操作、截图、PDF生成、性能优化和JavaScript交互,适合自动化测试和网页数据抓取。开发者可通过简单的安装和初始化快速搭建自动化流程,提高开发效率。

Puppeteer - Sharp:赋能开发者的浏览器自动化利器

dotNET跨平台 dotNET跨平台 · 2025-08-18T00:02:39Z

Reddit发现AI公司利用Wayback Machine绕过数据限制,非法抓取历史数据进行模型训练,侵犯用户隐私。尽管Reddit已限制API和数据抓取,AI公司仍通过缓存等方式获取数据,导致与Wayback Machine的合作关系面临挑战,数据所有权与AI训练需求的冲突加剧。

偷数据的AI公司被抓到了

量子位 量子位 · 2025-08-13T07:58:09Z
安装在近100万台设备上的浏览器扩展程序利用用户IP帮助AI公司抓取内容

研究发现245款浏览器扩展程序含恶意JavaScript库,利用用户设备抓取数据。谷歌已开始删除这些扩展,用户可能会收到警告。该库通过用户IP隐秘抓取,存在安全风险,可能导致跨站脚本攻击。

安装在近100万台设备上的浏览器扩展程序利用用户IP帮助AI公司抓取内容

蓝点网 蓝点网 · 2025-07-11T03:17:00Z
社交网站X/Twitter修改开发者协议 即便付费购买API后也禁止拿数据训练AI

社交网站X/Twitter更新开发者协议,禁止使用购买的API抓取数据进行AI模型训练,违反者可能面临账号封停或起诉。新协议加强了数据访问限制,影响开发者和用户的正常使用。

社交网站X/Twitter修改开发者协议 即便付费购买API后也禁止拿数据训练AI

蓝点网 蓝点网 · 2025-06-06T00:22:22Z
知名网络论坛Reddit起诉Anthropic指控其未获得许可抓取内容训练AI

Reddit 起诉人工智能公司 Anthropic,指控其未经授权抓取数据以训练 AI 模型,违反用户协议。Reddit 指出 Anthropic 忽视 robots.txt 协议,要求赔偿并禁止其使用内容。Anthropic 尚未作出明确回应。

知名网络论坛Reddit起诉Anthropic指控其未获得许可抓取内容训练AI

蓝点网 蓝点网 · 2025-06-05T06:58:16Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码