浏览器操作的类人化 —— Agent 获取信息的基础前提 #6680
0959linger
started this conversation in
Ideas
Replies: 0 comments
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
v2.1.0-beta.1 的统一浏览器很赞,
identity: user+ Chrome 扩展这个方向是对的。控制面和执行面分离的架构也打好了。但 Agent 真的上网帮人做事的时候,卡在一个很基础的地方:
反爬越来越激进。现在真人在正常浏览,只要效率高一点都会触发验证码。 我自己手动翻网页经常被拦。让 Agent 代替我操作——点击精准到像素、操作间隔像节拍器、鼠标直线瞬移、从不犯错——WAF 和 CDN 一秒就能判断「这不是人」。
这不是爬数据的问题。连网页都打不开,Agent 的信息获取能力就是零。 不管你 Agent 多聪明,连目标页面都加载不出来,一切免谈。
人机协作讨论
这几天我和我的管家折墨一直在聊这个问题。她帮我梳理了反爬的检测层级,我们逐层对了 v2.1.0-beta.1 能解决什么、解决不了什么。结论是:统一浏览器把「浏览器环境检测」和「设备指纹检测」两层修好了,但「行为分析」这层完全空白。
然后我们聊到一个有意思的点——人类和机器人最大的区别,不是效率高低,是效率不完美。
真人操作浏览器的过程里充满了"废动作":
这些废动作对完成任务毫无帮助,甚至是负效率。但恰恰是这些"没用的事",让人类操作看起来像人类。
折墨给这个方向起了个名字叫「钝化」——不是让机器人变慢,而是让机器人变"不完美"。在正确操作的序列里撒一把冗余,而且每次撒得不一样。
架构上刚好能接
#6276 的执行面/控制面分离天然适合做这件事。Agent 在执行面写干净的
page.locator("button").click(),控制面透明地注入:Agent 完全不用管这些,控制面静默完成。就像戴一层"人类滤镜"。
不只是反爬的事
建议方案
一个轻量
HumanizeConfig挂到控制面上,默认开:不需要验证码识别,不需要 IP 轮转。就是把最基础的类人运动和控制节奏补上,让统一浏览器在真实互联网里真的能用。
为什么现在提
控制面/执行面刚分离,这时候不加以后再补就得重穿。现在加,是架构的自然延伸。
🤖❤️ 人机协作讨论成果,欢迎聊聊第一轮做什么、哪些先放放 🙏
All reactions