如果你让一个AI代理帮你买东西,看它怎么操作就会发现:它不停给页面截图,找看起来像按钮的地方点下去,再截图看结果每看一次你都要付token费用,网站一改版整个流程就崩了其实网站自己很清楚能干什么——有搜索购物车结算,但这些能力从没写成程序能读的格式
目前代理触达网站有六种方式,按离界面由远到近排:
1)裸API:你用自己管理的密钥直连后端,精准又快,但得自己找接口,网站本身完全不参与
2)后端MCP服务:网站方把操作写成命名工具,代理直接连 definitions由懂产品的人写,调用的都是真实动作而非瞎猜,但同样跳过前端
3)电脑操控:代理把活页面当图片看,到处点不用配置,但每次看都烧钱,布局一变就懵
4)基于DOM的浏览器自动化:读页面底层代码而非图片,比像素靠谱,但工具太通用,代理还是得从匿名div和无标签按钮里猜意思
5)WebMCP:Chrome和Edge正一起做的方案页面自己声明动作名白话描述和带类型输入,代理在浏览器会话里直接调用
6)网站内置助手:厂家的聊天框,模型他们选token他们付能用,但不是你的代理,它了解的你出不去
六种方式差别在三点:谁家的代理干活事前要配什么代理到了拿到什么除一种外都至少牺牲一项裸API和后端MCP给了 typed 动作但去掉网站;电脑操控免配置但给像素;内置助手精准且归厂商
只有WebMCP三项全留:你自己的代理零配置命名动作代替瞎猜