千问刚开源了 Qwen-AgentWorld,自称首个原生语言世界模型,能在 MCP、Search、Terminal、SWE 以及 Web/OS/Android 七个领域模拟智能体交互,还配了带真实环境观测的 AgentWorldBench。我的困惑是:用语言模型去“扮演”环境,训练出来的 Agent 迁到真实终端和真实浏览器时,掉点会有多大?你们在实际项目里,语言世界模型更适合当低成本预训场,还是已经能扛住正式评测和上线前的回归?判断能不能替换真实环境时,你们通常看哪几个指标?
相似问题