ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

整个互联网的活人头一次成了少数派,机器大军到底在后台干什么

整个互联网的活人头一次成了少数派,机器大军到底在后台干什么 整个互联网的活人头一次成了少数派机器大军到底在后台干什么你每天在手机上刷网页、看新闻、查资料的时候大概总觉得屏幕另一端连着的是无数个和你一样有血有肉的普通人。但现实在不声不响中彻底翻了个面。就在不久前负责给全球超过百分之二十网站守门的基础设施巨头Cloudflare在后台监控仪表盘上目睹了一条令人吃惊的交叉曲线2026年5月整个互联网上由自动化程序和机器生成的流量正式在总量上超过了全人类产生的所有流量。人类在自己亲手建造的赛博世界里头一次变成了少数派。一、最懂网络的人为什么一连三次算错时间2025年11月在里斯本举行的网络峰会上Prince根据当时后台平缓爬升的曲线底气十足地做出过一个公开预测非人类流量大概会在2027年下半年超过人类流量。那时候大家觉得还有大把时间做准备。然而仅仅过了几个月到了2026年3月举办大会时随着各类人工智能助手如雨后春笋般冒出来帮人上网办事后台的自动化请求猛然抬头。Prince不得不修正自己的模型把那个交叉的时间点提前到了2027年上半年。让所有人措手不及的是到了2026年5月工程团队突然跑进办公室告诉他不用等明年了自动化流量超过人类流量的那道分水岭就在这个月刚刚跨了过去。从预测的2027年下半年直接提前到2026年5月这位顶级科技巨头掌门人的时间表被现实狠狠往前拽了一年半。Prince承认自己此前每一次预测都错得离谱而且每一次都错在低估了机器繁衍膨胀的速度。到了2026年6月初官方公开的仪表盘上显示来自机器人的网络请求已经占到了百分之五十七点四人类留下的足迹只剩百分之四十二点六。随后这个数字继续狂飙直接冲破了百分之六十的大关。二、六十四次进门翻箱倒柜换不来一个真正进店的客人机器流量的这种爆炸式增长普通网民坐在电脑前几乎毫无察觉但那些辛辛苦苦建网站、写内容的人却先一步收到了快要把人逼疯的服务器账单。一家新西兰的新闻网站做过一次极其详尽的真实记录。他们在网站底层安装了专门的监控记录插件从2026年9月16日下午到9月27日早晨连续十一天逐一核对每一个来访程序的身份。他们利用各大厂商公开的地址段进行严格校验把那些自称是正规机构的访问标记为已验证、伪造或者未验证甚至还记录下了这些程序后续究竟带回了多少真正的活人访客。记录下来的十一天账本让站长哭笑不得。在这段时间里各类人工智能机器人总共朝他们的小网站发起了12396次抓取请求但是各大人工智能助手在同期带回给网站的真人点击量仅仅只有可怜的194次。这意味着机器跑来疯狂敲了64次门把屋里的文章翻了个底朝天最后才能换回一个活生生的读者进店看一眼。这194次来之不易的回流访问分散在179个不同的人类访客身上其中来自ChatGPT的有96次来自Gemini的有67次Perplexity带回16次Copilot带来9次Claude带来5次Meta AI则仅仅贡献了可怜的1次。更耐人寻味的是这上万次请求的构成。很多人以为爬虫全是为了抓取数据回去给模型做训练但实测数据显示专门收集训练语料的爬虫其实只占百分之十六占据百分之四十的是用于搜索引擎索引的程序而最大的一块大头足足占了百分之四十四全都是因为有人在问答界面里临时提了一个问题人工智能助手立刻实时冲进网页扒取信息的抓取行为。在所有的抓取程序中苹果的程序发起了3397次访问高居榜首其中绝大部分都在反复抓取新闻站点地图这类通道ChatGPT用于实时抓取的程序发起了2823次Claude的实时程序也有2557次亚马逊的程序跑了1642次专门用于搜索索引的程序发起1231次Perplexity抓了213次而Claude用于模型训练的程序只有186次。在这家新西兰网站的服务器上还出现了一个令人啼笑皆非的现象。该网站专门设置了一个发布海啸警报的页面在十一天里被ChatGPT的实时访问程序请求了整整424次占到了这个程序对全站总流量的百分之十五。这些请求几乎每隔半小时就准时出现一次中位间隔只有32.5分钟无论白天黑夜从不停歇而且全都通过了官方地址校验显然是有用户直接把问答助手当成了全天候监控海啸动态的定时任务。除了抓取极其频繁机器的速度也快得让人头皮发麻。该站在几天里发布的70篇文章中被Anthropic旗下的训练程序抓走了50篇从文章公开发布到被机器抓取中间的延迟中位数还不到4个小时最快的一次甚至只用了33分钟。对于一个原本用来收集素材做长期训练的程序来说这几乎跑出了专业新闻采编的时效。Matthew Prince在2026年9月27日公司成立十六周年的年度创始人信里用了一个生活里极接地气的例子来拆解这种荒唐的成本错配假设你让一个智能助理替你决定中午吃什么这个程序会在几秒钟之内飞快浏览附近1000家餐厅的在线菜单最后精心挑选一家推荐给你。那一家被翻牌子的幸运餐厅确实拿到了午餐订单但剩下的那999家餐厅呢它们的服务器同样被机器狠狠冲击了一遍白白垫付了昂贵的带宽和计算成本最后却连一毛钱的收益都没有捞到。三、筑起高墙与重新给网页贴上价格标签既然机器大军只占便宜不买单早就被高额电费和带宽账单逼到墙角的出版商们终于坐不住了。2026年9月29日来自康泰纳仕、赫斯特杂志、今日美国母公司以及《西雅图时报》等机构的300多名出版业巨头齐聚华盛顿特区。这是由新闻媒体联盟发起的一场声势浩大的游说行动参加人数是上一年的两倍还多日程也延长了整整一天。让这些传媒高管们下定决心的是一组令人心惊肉跳的行业追踪数据。监测机构TollBit公布的最新报告显示仅在2026年上半年其监测的站点就遭受了超过220亿次来自机器人的密集抓取而同期的总访问量也不过9870多亿次。在各大出版商的网站上机器访问与真人访问的悬殊比例从2025年第一季度的约1比200坐火箭般暴增到了2025年第四季度的约1比31在短短一年内膨胀了六倍还要多。出版商们这次在华盛顿全力推动的是一部名为《隐形机器人禁制法》的联邦提案。这项跨党派法案由三位众议员在2026年7月提交国会。此前在2026年6月纽约州就已经率先通过了州一级的类似法案随后还有密苏里、内布拉斯加、田纳西、得州、犹他等至少五个州跟进提出了同类提案。法案并没有一棍子打死所有抓取技术也没有强制要求各方必须达成协议它的核心要求非常简单任何程序在爬取别人的网站时必须一清二楚地亮明自己的真实身份与具体用途绝对不允许伪装成普通人类设备溜进后台也不允许偷偷劫持家用网络设备来伪造人类的浏览痕迹。一旦查实隐瞒身份违规抓取美国联邦贸易委员会与各州总检察长将有权介入执法每一次违规最高可以处以5.3万美元的民事罚款。作为守在全世界五分之一网站最前方的巨头Cloudflare干脆直接拿出了技术工具来倒逼规则落地。2026年9月15日他们把后台原本只有一个的总开关直接细化拆分成了三个独立的控制阀门分别对应网页搜索、模型训练以及办事助手。针对那些把常规搜索和模型训练混在一起抓取、占了全网已验证爬虫流量百分之三十六点六的混合型爬虫Cloudflare直接把免费客户的后台默认设置改成了全面屏蔽阻断Google将这些网站内容拿去给模型做训练。Prince在访谈里的态度十分坚决如果大公司不肯把用于网页检索的爬虫和用于模型训练的爬虫分得清清楚楚那就索性一律拦在门外。不过在英国做出相关裁决以及布鲁塞尔展开询问之后行业规则也开始松动Google已经承诺要提高透明度允许出版商逐页决定内容是否可以用于训练并且承诺退出训练不会影响搜索排名。除了架起防御工事一套崭新的交易规则也在悄悄搭建。Cloudflare正联手支付机构Stripe与Coinbase试图在最基础的网络协议里重新激活一个尘封已久的古老状态码需要付费。他们的规划是建立一个微支付通道让网站主可以明码标价按每次抓取向来访的机器程序收取不到一美分的费用。内容越稀缺、越有价值收费就可以定得越高。这个构想在业内引起了巨大争论虽然有业内人士质疑微支付换来的碎银子根本撑不起专业出版机构的开销但Prince对此显得很有信心。他和妻子在犹他州拥有一家地方报纸《Park Record》根据他的测算今年这家小报纸靠着把内容授权给各家模型所拿到的收入就已经要超过苦苦经营多年的传统数字广告了。而在当下的内容授权市场上社交平台Reddit凭借高频的人类问答语料在换取收入时的身价甚至达到了《纽约时报》的7到14倍。在这场围绕内容与通道的激烈角力中原本用来给人类阅读浏览、分享思想的网页正在被成群结队的人工智能快速变成冰冷的数据原料。旧时代的广告模式在失效新时代的计费水表正被一块块安装在服务器的大门口。这场发生在整个网络底层的围剿与重构最终关乎的不是某一家技术公司的兴衰而是未来的互联网世界究竟会萎缩成几家闭门造车的人工智能巨头乐园还是依然能给无数独立写作者和中小型网站留下一条赖以生存的活路。
返回列表