AI大厂,突发利空

3 次阅读 2026年07月07日
众所周知,现在的大语言模型,归根结底是对海量文本的模式进行复杂的拟合。 对AI公司而言,数据是一切的源头,重要性排在第一位。 但现在,这个源头,出了变故。 7月2日,网络基础设施与安全巨头Cloudflare,向全球所有AI公司发出最后通牒: 在2026年9月15日前,必须将“搜索引擎”爬虫与“AI训练数据/代理”爬虫标识彻底分离。 届时,任何挂羊头卖狗肉的混合爬虫,系统直接物理断网、全局拦截。 这就等于,给整个AI行业上了一把锁。 至于原因,想也想得到:分赃不均。 英伟达在物理层面拿捏所有算法公司,赚的盆满钵满。 在互联网世界,网络基础设施企业又何尝不是“卖铲人”的生态位? 凭什么不能分一杯羹? 01 Cloudflare是哪路神仙? 可以把它理解为全球互联网的“海关”,类似高速公路的收费站。 它处理着全球约20%的互联网流量,提供内容分发网络(CDN)、域名系统(DNS)、DDoS攻击防护以及Web应用防火墙(WAF)等底层基础设施服务。 人称“赛博菩萨”。 何解? 过去十几年里,它为全球无数中小网站、个人博客提供了免费且强悍的抗DDoS攻击和CDN加速服务。 关键词,免费。 但就是这么一位慈眉善目的菩萨,此时此刻却满脸怒火。 根据Cloudflare的监测数据,2026年上半年,Bot(机器人/爬虫)流量已经超过了人类流量。 “原本业界预测这个转折点要到2027年才会发生,但Agent的爆发让进度提前了一年。” 按照目前的趋势,短短五年内,机器与人类的流量比例将达到1000:1。 这明显会导致一个问题:当互联网的主要使用者从人类变成AI时,底层商业秩序必然崩溃。 互联网时代存在一个基本的搜索爬虫与流量反哺机制: 你建了一个网站,提供优质内容;谷歌等搜索引擎的爬虫来你的网站抓取内容。 作为回报,搜索引擎把网页收录进索引池。当用户搜索相关问题时,搜索引擎展示网站链接。 用户点击蓝色链接,流量倒流回站长的网站,你靠这些流量卖广告,赚到了钱。 这是一个运行了30年之久的完美双赢闭环。 你出内容,我出技术,大家一起发财。 但生成式AI毫无疑问破坏了生态契约。 现在的剧情是这样的: AI大厂的爬虫扫荡网站,把创作者的内容塞进大语言模型里进行预训练或者微调。 当用户向AI、或者带有AI概览的搜索引擎提问时,AI在搜索界面输出总结好的内容。 根据第三方SEO增长社区和互联网的审计数据:OpenAI的GPTBot爬取一个网站大约1500次,只能给该网站带来1次点击引流。 当谷歌搜索结果中出现AI生成的摘要时,用户点击搜索链接的概率暴跌至8%,点击AI摘要内部引用链接的概率更是低至1%。 这就是现在常说的“零点击搜索”。 AI几乎拿走了所有价值,创作者得到的流量反馈≈0。 完全就是强盗,吃干抹净一点都不给原主人留。 无论从什么角度来看,这都是不能容忍的。 但是,网站主们对此毫无办法。 核心原因就是Cloudflare此次针对的靶点:混合用途爬虫。 根据Cloudflare官方的控诉,越来越多的AI爬虫蓄意伪造其User-Agent头部信息,伪装成急需给网站引流的搜索引擎爬虫,堂而皇之绕过robots.txt的限制,无限制下载网页。 这就陷入了经典的囚徒困境: 一刀切封杀,混合爬虫是进不来了,但网站连搜索结果页面都上不去了;不封杀,死得更快。 不论怎么样,都是个死。 此时此刻,也只能让“菩萨”出面主持公道了。 02 根据《Configure AI bot policies》白皮书,Cloudflare正式放弃“人类orAI”的二元分类,而是从“行为动机”和“用途分类”入手,将全网自动化流量划分为三个类别: 搜索类:为传统搜索引擎建立索引、事后给网站导流的爬虫 智能体类:用户的实时检索爬虫,属于检索增强生成行为 (比如用户问GPT某个问题,AI实时放出的ChatGPT-User爬虫) 训练类:无差别大规模数据抓取,给大模型做预训练 自2026年9月15日 起,所有接入Cloudflare的新域名用户,其安全策略将自动变更为:允许Search,默认拦截Training和Agent。 如果某个AI大厂拒不配合,继续派出同时兼具搜索和训练目的的混合型爬虫,会怎么样? 根据Cloudflare的规则,将按照最严标准惩罚:100%全盘拦截,连Search的功能也被禁止。 如果爬虫强行伪装呢? 作为抗DDoS起家的安全巨头,Cloudflare有的是办法。 1.行为分析 WAF会分析请求头、TLS指纹、甚至HTTP/2连接并发特性。 在Cloudflare每天千亿次流量的大数据面前,AI几乎不可能用无头浏览器伪装成人类。 2.反向吸血 利用AI迷宫蜜罐技术,在瞬间动态生成一个无限虚假页面迷宫。 AI爬虫一旦掉进去,就会在无数的垃圾虚假内容中死循环,消耗掉AI公司巨额的算力和带宽成本。 3.网络机器人身份验证 Cloudflare牵头搞了一套开放框架,要求合规的AI机器人和自动购物Agent,必须通过加密手段向发布商自证清白,证明身份和意图合法 …… 如此一来,最受伤的是谁? OpenAI、Anthropic、Perplexity等算法公司一定会损失大量中小网站、垂直社区的数据。 至少,不能像以前那样白嫖了,必须花钱和网站主签授权协议。 最大的代价无非就是,训练模型的成本变高了。 比如OpenAI,早就拆分了爬虫:用于训练数据抓取的是 GPTBot,用于ChatGPT实时联网查询的是 ChatGPT-User。 只有谷歌这个缝合怪不一样。 全球AI爬虫流量占比 (2026年Q2) 长久以来,谷歌利用自己在全球搜索市场超过90%的垄断地位,让Googlebot畅通无阻,堂而皇之用抓来的数据喂养Gemini。 为了保住在谷歌搜索里的排名,没有哪个网站敢得罪,除非你想在互联网世界蒸发。 Cloudflare甚至直接点名:“因为他们让网站陷入了‘如果不把内容交给AI使用,就难以在搜索结果中被搜索到’的被动局面,导致目前某最大搜索引擎掌控的信息量,是其他领先AI公司的两倍之多。” 等到9月15日,谷歌将面临极为痛苦的选择: 不分拆Googlebot,将失去对全球20%网页的索引能力,搜索质量出现灾难性下滑;但如果分拆 Googlebot,明确剥离出搜索爬虫和训练爬虫,Gemini又将立刻面临断炊的危机。 而且,可以预见的是,继Cloudflare后,绝对会有越来越多网络基础设施企业跟进类似政策。 这等于是剥夺了谷歌利用垄断地位捆绑索取数据的特权,被强行拉到了和OpenAI等初创算法公司同样的起跑线上。 03 互联网苦AI小偷久矣。 Cloudflare这次的举动,可谓是大快人心。 不过,这当然不是事情的全部。 经不可轻传。 就算是佛也爱钱,何况Cloudflare只是“赛博菩萨”。 正如我们开头所说,任何矛盾都能在一定程度上解读为分赃不均。 堵不如疏。 AI的进化,毕竟是大势所趋。一味地无脑封锁,只会让Cloudflare站在整个市场的对立面。 其实早在2025年7月,Cloudflare就试水推出了“Pay Per Crawl”(按爬取次数付费)机制。 AI公司按抓取了多少数据、多少个页面来算账,Cloudflare抽成后把钱分给网站。 但这个模式有明显的漏洞:AI公司觉得亏,因为大量垃圾网站充斥着的垃圾信息,也得付钱;优质网站也亏,自己的精华内容,凭什么和垃圾信息一个价? 所以趁着本次对全球AI公司发出最后通牒的机会,Cloudflare正式推出新机制,Monetization Gateway(货币化网关)和“Pay Per Use”(按使用次数付费)。 当AI在回答用户问题并引用了某个接入Cloudflare保护的网站内容时,Cloudflare就能通过数字指纹和API审计技术判定:“这次回答,你使用了某某网站的知识资产。” 简单来说,OpenAI等公司,不需要去与全球数以千万级的中小网站签授权协议(本来也无法做到),只要接入Cloudflare的统一API、预存“版权保证金”,就能合法拥有全球互联网23.5%的内容。 每流过一笔版权费,Cloudflare就抽走一笔过路费。 等于是收税。 这世上还有比收税更好的生意吗? 如果所有AI公司和网站都通过Monetization Gateway进行数据交易结算,即便税率再低,它也有望超越传统金融巨头。 Cloudflare CEO的说法是这样的:“在未来,每次访问一个网站获取信息,你可能只需支付几分之一美分。这意味着,作为基础设施,我们必须能够在第一天就支持每秒大约1000万笔的金融交易,并且未来要扩展到每秒1亿笔交易——这比现有的Visa网络还要大两个数量级。” 但这一趋势,对行业造成的影响也是非常明显的。 AI模型数据荒将提前到来,且数据成本陡增。 随着Cloudflare(以及后续大概率会跟进的Akamai等厂商)切断白嫖通道,高质量的公开网页数据彻底变成了有源之水、有表之计。 AI大厂不得不将扩大支出购买优质数据版权;没钱支出长期版权账单的中小公司将被加速淘汰。 原本越来越不被看好的创作者经济,则会因此重新繁荣。 这次事件,本质上是互联网原住民对AI野蛮资本的绝地反击。 Cloudflare如果能够成功推行并确立行业标准,毫无疑问将为创作者提供一条新的生存之道:从“向人类卖眼球广告”,转变为“向AI卖高质量的高密度语料”。 从这个角度看,人与AI的关系还真是微妙。 本文来自微信公众号“格隆”,作者:万连山,36氪经授权发布。

(7)

༺❀田ൢ༗༒༗宇ൢ❀༻

这AI数据使用的事儿太乱了,Cloudflare出来管管挺好。不过抽成收税这招,也挺会赚钱的,就看能不能推行下去了。

0
蓝蓝的
蓝蓝的 3周前

AI公司以后成本要高咯,中小公司估计更难了,创作者经济可能真要复兴。

0
财神zhu
财神zhu 3周前

以前AI白嫖惯了,现在创作者能分点钱,也算是公平点。

0
想理汽车法务部

数据源头被锁,AI大厂得想新办法搞数据了,不然模型训练都成问题。

0
Love Xquisite Passio

Cloudflare这是要当行业规则制定者啊,就看其他企业跟不跟风。

0

新西兰发放近海油气勘探许可

新西兰政府29日授予一家私营企业许可证,允许后者在塔拉纳基盆地近海区域展开12年期的石油勘探,为去年解除相关禁令以来首例。

也门胡塞武装拟对途经红海南部的商船征收通行费

市场消息:也门胡塞武装拟对途经红海南部的商船征收通行费。

花旗将迪士尼目标价从145美元下调至135美元。

花旗将迪士尼目标价从145美元下调至135美元。

花旗将Visa目标价从400美元上调至440美元。

花旗将Visa目标价从400美元上调至440美元。

花旗将康宁目标价从240美元下调至220美元。

花旗将康宁目标价从240美元下调至220美元。

国家网信办就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室会同有关部门起草了《中华人民共和国反网络暴力法(征求意见稿)》,现向社会公开征求意见。

渤健公司股价在公布第二季度业绩后盘前下跌2.2%。

渤健公司股价在公布第二季度业绩后盘前下跌2.2%。

中国-东盟区域医药交易(集采)平台推动国产手术机器人在越南进入临床使用

国家医保局消息,近期,中国-东盟区域医药交易(集采)平台助力国产手术机器人完成越南产品注册并取得上市许可,在越南部分头部医疗机构完成安装并投入临床应用,实现了国产大型医用设备在越南从产品注册到临床应用的重要突破。同时,还将推动中越双方就机器人手术技术培训、临床应用推广、学术交流、人才培养等方面开展深度合作。

花旗将希捷科技目标价从1240美元上调至1300美元。

花旗将希捷科技目标价从1240美元上调至1300美元。

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见。

为了预防、制止和惩治网络暴力,加强反网络暴力工作,保护个人、组织的合法权益,维护国家安全和社会公共利益,按照有关立法规划计划安排,国家互联网信息办公室就《中华人民共和国反网络暴力法(征求意见稿)》公开征求意见。