网络爬虫与网站之战:数据为何要“藏着掖着”?

· Paul Kolomiets

这周我算是经历了一趟“服务条款”与“公开内容”之间的奇幻之旅——说它公开吧,确实谁都能看;说它能用吧,又不尽然。与其写一份枯燥的“操作报告”,不如咱们一起来琢磨琢磨:我们是怎么走到这一步的?

当然,读法律条文这爱好确实有点怪,您就当我任性吧。网站说要保护内容,实际上,他们更怕的是失去对“访问方式”的控制权。数据明明在浏览器里对公众开放,但你要想用程序自动抓取——不好意思,门都没有。

为什么?因为一旦有了“非官方”的访问渠道,广告就没法卖了,用户行为分析的数据源也断了,付费功能也会被架空。

非要举个具体例子的话,可以翻翻当年 hiQ 诉 LinkedIn 的旧案。简单来说,hiQ 主张“数据既已公开,就该谁都能用”,但法院的逻辑是:服务条款(ToS)作为与最终用户的契约,优先级更高。说白了,数据主人立了规矩,你不服也不行。

——当然,我这是把法律结论往简单里说了。要是您真想深究,建议自己多花点功夫去查,法律措辞远比这复杂得多。

从那以后,我们就活在了这种“薛定谔的可用性”里:啥都能看,又啥都不能用。

好笑吧?以前倒也相安无事,直到——机器人来了。

AI 应用场景一出现,这套逻辑就有点绷不住了。比如说,你的 AI 助手“遵纪守法”,它不主动违规,只是在你手动浏览网页时,默默帮你收集信息。

可问题是,你真会这么干吗?手动翻几百页网页,就为了攒够分析用的数据?这例子虽然极端,但很说明问题——真要这么守规矩,累也累死了。

更何况,即便你“合法操作”,你的行为模式也已经变了:请求的数据量暴增,每个页面停留时间极短,广告基本无视……这些恰恰触动了 ToS 限制条款的敏感神经——还记得我开头说的吗?绝大多数限制,针对的就是这类行为。

但更关键的是,这种情况不仅适用于 AI 机器人用户,也适用于那些依赖 AI 搜索的普通用户。前一类用户,网站或许可以睁一只眼闭一只眼;但后一类——那可是海量人群,他们可能压根儿就不点进网站,答案在搜索结果页就搞定了。

如果这种趋势真的起来,无非两个走向:要么 ToS 逐渐松绑,要么搜索引擎和大型内容平台之间开始大量签约——就像 Reddit 和 Google 那样。

我个人倾向第二种 scenario 会碰壁:要么撞上搜索引擎的垄断地位,引来监管介入;要么对内容方来说,这笔买卖根本不划算。我真心希望,未来我们走向的是“内容变现新方式”,而不是“建起更高的围墙”。

要说变局的关键,我觉得只有一个突破口——付费访问。如果付费账号允许 AI 机器人享有更广泛的数据采集权限,那对内容提供方和深度用户来说,可能是个双赢的替代方案。

当然,您可能觉得我这预测有点离谱。也罢,今天的水晶球大概信号不好。

最后再强调一遍我最核心的看法:用户的行为模式已经变了。这个变化会倒逼网站去适应——而且大概率,是朝着“更开放”的方向走。

如果你手头也有类似的想法或任务在进行中—— 欢迎进一步了解我, 或者 直接给我留言。 最不济,我们也算多了一个有意思的话题可以聊聊,然后各自回到自己的代码里。