小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

本文介绍GeekAgent第12天开发:新增search和fetch两个工具。search在权限目录内按内容搜索代码,返回文件:行号:内容,跳过node_modules和二进制文件;fetch读取网页并转纯文本,访问前需确认URL。两者均注册到工具系统,search用safePath限制目录,fetch用authorize确认。实现采用Node内置glob和正则剥标签,不依赖额外库,适合小型仓库。

从零实现 GeekAgent —— Day12 代码搜索与网页抓取

极客兔兔 极客兔兔 · 2026-08-31T13:30:00Z

本文介绍如何用Python构建AI网页抓取器:先抓取网页,用BeautifulSoup清理HTML,再用markdownify转为Markdown,最后调用OpenAI模型回答用户问题。通过减少噪音和token消耗,输出简洁的Markdown答案。文章还讨论了成本考量,建议根据需求选择自建或使用现成工具。

如何用Python构建一个简单的AI网页抓取器

KDnuggets KDnuggets · 2026-08-14T14:00:29Z
刚刚,首个空间原生的具身视觉基模开源!机器人更会看我们的世界了

蚂蚁灵波推出的LingBot-Vision和LingBot-Depth 2.0显著提升了机器人对透明和复杂物体的视觉识别能力,增强了物体边界和空间关系的识别,从而提高了抓取和导航的稳定性。这一进展对家庭服务和工业巡检等场景具有重要意义,标志着具身智能在视觉感知领域的突破。

刚刚,首个空间原生的具身视觉基模开源!机器人更会看我们的世界了

量子位 量子位 · 2026-07-07T04:48:40Z
X/Twitter 长文复制不了?用 Codex 自动抓正文、图片和互动数据保存成 Markdown

本教程指导新手如何抓取 X/Twitter 长文并保存为 Markdown 文件。步骤包括安装 Python、创建工作目录、安装抓取工具、导出登录 Cookie、使用命令行抓取长文以及将 HTML 转换为 Markdown。建议先测试一篇文章,确保流程顺利后再进行批量操作。

X/Twitter 长文复制不了?用 Codex 自动抓正文、图片和互动数据保存成 Markdown

文武科技柜 文武科技柜 · 2026-07-01T12:07:54Z
Strava指责无代码AI应用和抓取工具,收紧API访问权限

Strava因应AI抓取工具的影响,开始限制API访问,开发者需支付每月11.99美元的订阅费,以应对抓取行为对平台性能的影响。同时,Strava推出新工具,允许用户将健身数据链接到Claude,但API限制不影响可穿戴设备的整合或用户免费下载数据的能力。

Strava指责无代码AI应用和抓取工具,收紧API访问权限

The Verge The Verge · 2026-06-01T14:06:44Z
构建真正有效的专业网页抓取工具

这篇文章介绍了一个全栈网页抓取课程,旨在帮助用户绕过现代网站的反自动化检测。课程由Gavin Lon开发,内容涵盖使用Playwright和Cheerio工具、配置住宅代理和浏览器指纹,以及构建可视化实时数据的MERN应用。课程在freeCodeCamp.org的YouTube频道上提供,时长6小时。

构建真正有效的专业网页抓取工具

freeCodeCamp.org freeCodeCamp.org · 2026-05-29T15:19:17Z
传统抓取与AI抓取:开发者和数据团队的实用指南

网络数据生成量巨大,开发者面临可靠抓取的问题。传统抓取依赖选择器提取数据,但结构变化会导致失败。AI抓取通过理解内容而非结构提取数据,适应性更强。两者各有优劣,结合使用更为有效。

传统抓取与AI抓取:开发者和数据团队的实用指南

freeCodeCamp.org freeCodeCamp.org · 2026-04-16T21:37:47Z
被谷歌起诉的网络爬虫声称是谷歌在抓取网络

SerpApi正在与谷歌进行版权诉讼,谷歌指控其以欺骗手段抓取搜索结果。SerpApi辩称,谷歌并不拥有搜索结果的版权,其抓取行为与谷歌相似但规模较小,并认为谷歌的反抓取工具仅保护其商业利益,而非版权内容。

被谷歌起诉的网络爬虫声称是谷歌在抓取网络

The Verge The Verge · 2026-02-20T20:06:46Z
在被抓取300TB音乐文件后Spotify发布回应 称已经封禁参与抓取的账号

Spotify确认其平台被抓取300TB音乐文件,涉及99.6%的歌曲。相关账号已被封禁,并加强了安全措施。

在被抓取300TB音乐文件后Spotify发布回应 称已经封禁参与抓取的账号

蓝点网 蓝点网 · 2025-12-25T01:58:45Z

谷歌今日对爬虫公司SerpApi提起诉讼,指控其非法抓取受版权保护的内容并绕过安全措施,旨在保护网站和版权方的权益。谷歌遵循行业标准的爬虫协议,而SerpApi则通过隐蔽手段侵犯这些协议,影响内容提供者的选择权。

我们为何对SerpApi的非法抓取采取法律行动

The Keyword The Keyword · 2025-12-19T17:51:00Z

谷歌今天起诉爬虫公司SerpApi,指控其非法抓取版权内容并绕过安全措施,旨在保护网站和版权持有者的权益。谷歌遵循行业标准的爬虫协议,而SerpApi则通过不当手段获取内容。

我们为何对SerpApi的非法抓取采取法律行动

The Keyword The Keyword · 2025-12-19T17:51:00Z
2026年AI模型最佳网络抓取API

Bright Data的Web Scraper API为2026年AI模型提供动态网站支持、反机器人自动化和全球覆盖,特别适合数据驱动团队。与Oxylabs、ScraperAPI和Apify相比,Bright Data在灵活性、可靠性和规模上表现更佳,是网络抓取的首选。

2026年AI模型最佳网络抓取API

KDnuggets KDnuggets · 2025-12-07T11:00:17Z
2026年大型数据抓取的最佳代理服务提供商

文章比较了四大代理服务提供商:Bright Data、Oxylabs、Infatica和NetNut,指出Bright Data在全球覆盖、合规性和反机器人技术方面的优势,适合高需求的企业级数据抓取。

2026年大型数据抓取的最佳代理服务提供商

KDnuggets KDnuggets · 2025-12-04T18:00:19Z
DotMemory系列:5. 如何实现自动化抓取和应用自托管

本文探讨了如何实现dotmemory软件的自动化快照抓取,介绍了测试代码和自托管的方法,通过代码控制快照时机,提升了效率,并展示了在不同平台上使用Console版进行内存分析的方式。

DotMemory系列:5. 如何实现自动化抓取和应用自托管

dotNET跨平台 dotNET跨平台 · 2025-11-20T00:02:07Z
DotMemory系列:5. 如何实现自动化抓取和应用自托管 - 一线码农

本文探讨了如何自动化抓取dotmemory快照,介绍了测试代码和自托管实现方法,通过代码控制快照时机,提高内存分析效率,减少手动操作。

DotMemory系列:5. 如何实现自动化抓取和应用自托管 - 一线码农

一线码农 一线码农 · 2025-11-18T03:06:00Z
Reddit论坛将阻止互联网档案馆抓取页面 因为AI公司从互联网档案馆抓取数据

Reddit 宣布禁止互联网档案馆抓取其内容,因 AI 公司通过该网站抓取数据违反使用条款。Reddit 要求 AI 公司签署商业协议并支付费用才能抓取数据。互联网档案馆目前只能有限抓取首页内容,双方正在沟通。

Reddit论坛将阻止互联网档案馆抓取页面 因为AI公司从互联网档案馆抓取数据

蓝点网 蓝点网 · 2025-08-12T00:48:40Z
Cloudflare称Perplexity的AI机器人正在对被封锁的网站进行‘隐秘爬取’

AI初创公司Perplexity被指绕过网站限制,继续抓取内容。Cloudflare报告称,Perplexity在被阻止时伪装身份,甚至冒充Google Chrome。Cloudflare已取消其认证,并推出阻止其爬虫的方法。

Cloudflare称Perplexity的AI机器人正在对被封锁的网站进行‘隐秘爬取’

The Verge The Verge · 2025-08-04T17:51:25Z

Cloudflare推出新功能,默认阻止人工智能爬虫抓取网站数据,需网站所有者授权,以保护原创内容,回应人工智能公司未经授权使用数据的争议。

Cloudflare 推出对人工智能数据抓取工具的默认阻断功能

程序师 程序师 · 2025-07-03T04:58:44Z
Cloudflare测试AI付费抓取功能 AI公司必须付钱才能抓取网站内容(附网站开通方法)

Cloudflare 正在测试一项新功能,允许网站向 AI 公司收费以授权其抓取内容。网站可以控制抓取的内容和价格,AI 公司需注册并支付费用。目前该功能仅在少数网站上测试,且需托管在 Cloudflare 平台上。

Cloudflare测试AI付费抓取功能 AI公司必须付钱才能抓取网站内容(附网站开通方法)

蓝点网 蓝点网 · 2025-07-02T04:34:09Z
去中心化社交网络长毛象(Mastodon)更新使用条款 禁止抓取数据用于训练AI模型

去中心化社交网络长毛象(Mastodon)更新使用条款,禁止未经授权抓取用户数据用于AI模型训练。新条款将于2025年7月1日生效,违者可能面临起诉。其他平台如X/Twitter和Reddit也已采取类似措施。

去中心化社交网络长毛象(Mastodon)更新使用条款 禁止抓取数据用于训练AI模型

蓝点网 蓝点网 · 2025-06-18T01:33:48Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码