尽管大模型的上下文窗口已从早期的几千 token 扩展到 200K 甚至更高,但对于超大规模代码库而言,完整加载所有相关上下文仍然具有挑战性。此外,Agentic Coding 任务通常涉及大量的工具调用和迭代循环,每次调用都会产生 token 消耗。一项典型 Agentic Coding 任务的平均 token 消耗约为 417 万,远高于单次代码补全或问答的消耗。如何在保证质量的前提下控制上下文成本和 token 消耗,是当前面临的重要挑战。
Agentic Coding 的长周期任务(可能需要数小时甚至数天才能完成)面临着上下文丢失、状态不一致和错误累积等风险。METR 在 2026 年 1 月更新的研究报告显示,Claude Opus 4.6 的"50% 成功率时间 horizon"已达到约 12 小时的人类工作量(相比 2023 年 GPT-4 的约 6 分钟有了数百倍提升)。但 Anthropic 自身数据也指出,API 用户直接让 Agent 自主完成任务时,超过 3.5 小时成功率会降到 50% 以下;而采用多轮对话引导方式的用户,50% 成功率可延伸到约 19 小时。这表明当前 Agent 更擅长在人类指导下处理一连串简单任务,而非一次性独立完成超复杂工作。
Agentic Coding 引入了全新的安全攻击面。OWASP 在 2025 年 12 月发布了面向 Agentic Applications 的 Top 10 安全风险列表,涵盖了 Agent 目标劫持、工具滥用、身份与权限滥用、供应链攻击、意外代码执行等多个维度。与此同时,企业对 AI 生成代码的安全治理严重滞后——绝大多数组织尚未建立针对 Agent 自主行为的审计机制和权限管控体系。填补安全与治理的缺口是 Agentic Coding 规模化落地的关键挑战。