首页 > AI教程 >Claude团队改爬虫名无视禁止规则引众怒

Claude团队改爬虫名无视禁止规则引众怒

来源:互联网 2026-07-05 06:25:00

Anthropic的ClaudeBot无视iFixit禁止抓取声明,以每分钟数千次频率疯狂访问,一天内抓取近百万次、10TB数据。修改robots.txt后仍被绕过,Anthropic回避回应。类似事件还包括LinuxMint论坛崩溃,OpenAI和Perplexity也被指控无视robots.txt协议。

不少网友对此颇为不满。一位从事文案工作的朋友在留言中直言:

“我觉得用‘偷’来形容Anthropic的这种行为,比‘不付费’要准确得多。”

长期稳定更新的攒劲资源: >>>点此立即查看<<<

Claude团队改爬虫名无视禁止规则引众怒

一时间,舆论哗然。

声讨者有之,要求Claude付费者有之,评论区彻底炸开了锅。

Claude团队改爬虫名无视禁止规则引众怒

这是怎么回事

这次被推上风口浪尖的,是一家名为iFixit的公司。它是美国一家电子商务与操作指南网站,其业务模式中颇为有趣的一环是:为消费电子产品和小工具提供类维基百科式的免费在线维修指南。

网站内容相当丰富,数百万个页面涵盖了修理指南、指南修订历史、博客、新闻帖子和研究报告、论坛、社区贡献的修理教程以及问答板块等。

然而,iFixit突然发现,自家网站正被Claude的爬虫程序ClaudeBot以每分钟数千次的频率疯狂访问,持续了数小时。

算下来,一天之内,这个爬虫几乎造访了它将近一百万次。

更具体的数据是,它在一天内抓取了10 TB的文件,整个5月份总计高达73 TB。

Claude团队改爬虫名无视禁止规则引众怒

对此,iFixit的CEO老K(Kyle Wiens)只留下一句话:

你没看错——「未经许可」。

事实上,iFixit早有声明:

未经iFixit明确事先书面许可,严禁以任何其他目的(包括训练机器学习或人工智能模型)复制、复制或分发本站的任何内容、材料或设计元素。

Claude团队改爬虫名无视禁止规则引众怒

然而,这纸声明似乎形同虚设。

Claude不仅置若罔闻地继续疯狂访问和抓取,还成功绕开了iFixit设置的防御手段。

iFixit原本已经成功屏蔽了两个Anthropic的AI抓取机器人,分别名为“ANTHROPIC-AI”和“CLAUDE-WEB”。

但很快发现,这两个机器人似乎已经“退休”,当前的主力爬虫正是那个未被拦截的“ClaudeBot”。

走投无路之下,老K表示,iFixit本周修改了robots.txt文件,专门用来阻止Anthropic的爬虫。

Claude团队改爬虫名无视禁止规则引众怒

那么,Anthropic对此有何回应?

它们倒也没有沉默,而是对媒体表态说:

当然,对于目前活跃的ClaudeBot是否遵守robots.txt协议、是否会避开被禁止爬取的内容,Anthropic巧妙地回避了正面回答。

AI公司不是第一次干这事儿了

翻看Anthropic的官方网站,会发现早已挂着一篇名为《Anthropic是否从网络上抓取数据?网站所有者如何阻止抓取工具?》的文章。

里面写得明白:

Claude团队改爬虫名无视禁止规则引众怒

但从舆论反馈来看,Anthropic实际所做的显然与它所说的并不一致。

未经允许爬取他人数据,这已是惯常操作。

就以今年4月为例,Linux Mint论坛就遭了殃。

数小时内,ClaudeBot多次访问论坛抓取数据,直接导致论坛长时间处于超低速甚至崩溃状态,最终彻底宕机。

有人统计过,同一时间段,ClaudeBot占用的流量是第二名的20倍、第三名的40倍。

Claude团队改爬虫名无视禁止规则引众怒

在4月事件和本次事件的讨论帖中,有人反复建议:

iFixit确实也这么做了。

而且效果立竿见影——不仅发现自家的信息被Claude爬了个底朝天,回头一看,竟然连OpenAI也跑来分了一杯羹。

Claude团队改爬虫名无视禁止规则引众怒

说实话,还有什么办法呢?似乎真的没什么辙了。

因为除了Claude和GPT,这样的“强行偷家”事件在AI圈里并不少见。

前几天,一家名为Tollbit的机器人检测初创公司就声称,Perplexity、Claude、OpenAI会无视网站上的robots.txt设置——当时有人询问OpenAI的态度,OpenAI直接不予回应。

Claude团队改爬虫名无视禁止规则引众怒

再往前推,上个月也闹过一出。

《福布斯》公开谴责AI搜索产品Perplexity涉嫌抄袭其新闻文章;一石激起千层浪,更多媒体站出来,指责Perplexity的爬虫机器人PerplexityBot非法抓取自家网站信息。

而Perplexity一直以来的态度是:

理论上,不管是ClaudeBot还是PerplexityBot,遇到标明了“禁止抓取”或“禁止robot.txt”的文件时,都应遵守协议,规避爬取声明方的内容。

既然声明无效,有人开始建议创作者将内容尽可能转移到付费区域,以此防止无限制的抓取。

你觉得,这一招真的会管用吗?

参考链接:

[1]https://www.404media.co/websites-are-blocking-the-wrong-ai-scrapers-because-ai-companies-keep-making-new-ones/

[2]https://www.404media.co/anthropic-ai-scraper-hits-ifixits-website-a-million-times-in-a-day/

[3]https://twitter.com/kwiens/status/1816128302542905620

[4]https://x.com/Carnage4Life/status/1804316030665396356

[5]https://support.anthropic.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawlerref=404media.co

侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述

热游推荐

更多
湘ICP备14008430号-1 湘公网安备 43070302000280号
All Rights Reserved
本站为非盈利网站,不接受任何广告。本站所有软件,都由网友
上传,如有侵犯你的版权,请发邮件给xiayx666@163.com
抵制不良色情、反动、暴力游戏。注意自我保护,谨防受骗上当。
适度游戏益脑,沉迷游戏伤身。合理安排时间,享受健康生活。