处理大型代码库的关键在于高效的索引和检索机制。现代 Agentic Coding 工具通过构建代码依赖图来管理大规模项目,将每个符号、导入关系、调用链和模块边界都纳入索引。当 Agent 需要理解某个功能时,不是逐文件读取,而是查询依赖图获取精确的相关函数及其调用关系和影响范围。这种基于图的上下文检索可以将 token 消耗降低 65% 至 70%,同时显著减少因遗漏依赖而导致的破坏性变更。
对于百万行级别的大型代码库,Agent 无法一次性将所有代码载入上下文窗口。因此,Agent 采用增量式加载策略:先读取项目结构和入口文件建立整体认知,然后根据具体任务按需加载相关模块的代码。这种"由粗到细"的渐进式理解方式,使得 Agent 能够在有限的上下文窗口内高效处理超大规模项目。
当单个 Agent 的上下文容量不足以覆盖整个任务时,可以采用多 Agent 并行协作的模式。Anthropic 曾通过 16 个并行 Agent 协作完成了 10 万行 C 编译器的编写实验。每个 Agent 运行在独立的上下文窗口中,专注于特定的模块或职责,通过标准化的接口进行通信和协调。这种分布式架构既避免了上下文污染,又显著提升了处理大规模任务的效率。