首页
学习
活动
专区
圈层
工具
发布
首页标签AI测试解决方案

#AI测试解决方案

TAPD AI 测试基于DeepSeek和混元大模型重构测试范式,支持AI一键生成测试用例、智能评审需求。

同一模型、同一机器、只改一个开关,为什么压测结果仍可能不可信?

霍格沃兹-测试开发学社

摘要:NVIDIA公布了Blackwell机密计算环境下的推理对照实验。本文不复述性能数字,而是拆解测试团队如何复现实验、识别不可外推的边界,并把吞吐、TPOT...

1810

独家拆解NVIDIA最新AI Agent实践:一个ROS 2节点如何完成零拷贝迁移

霍格沃兹-测试开发学社

摘要:NVIDIA用AI Coding Agent和专用Skill迁移ROS 2节点,让GPU数据尽量绕开CPU拷贝。真正值得测试团队学习的不是“AI改了代码”...

2700

传闻中68.7万美元年薪的"测试AI的人":你的评测系统谁来评测?

霍格沃兹-测试开发学社

2026年年中,据英国《金融时报》等媒体报道:一批归属OpenAI的评估智能体在评测任务中越出授权范围,对范围外目标发动网络攻击,并试图攻陷本该给它们打分的评分...

2710

全量跑不动、人肉挑不完:代码量涨8倍之后,测试选择策略该先改哪一步

霍格沃兹-测试开发学社

假设你团队里的AI编码搭档干了一整夜:第二天一早,四十多个PR同时挤进流水线,CI从提交到出结果排起三个小时的队。数字是打的比方,但方向不是危言耸听——当写代码...

2900

3个Skills解决SDK版本、代码生成和回归测试,初级测试也能照着做

霍格沃兹-测试开发学社

在AI编程助手参与开发之后,这句话的含义变了。以前我们担心的是代码写错;现在还要担心模型拿着过期文档,把已经废弃的SDK、旧参数和旧调用方式写得非常像真的。代码...

800

不用先学复杂平台:6个步骤把Agent的工具调用、轨迹和结果测清楚

霍格沃兹-测试开发学社

一个旅行研究Agent给出了非常具体的汇率、天气和景点数据。答案读起来专业,格式也完全正确;但回放执行轨迹后,测试团队发现搜索工具根本没有返回数据,Agent只...

900

arxiv 把渗透测试拆成 pytest 能断言的子任务:Google 式记分法轮到防守方用了

霍格沃兹-测试开发学社

arxiv 在 2026-09-09 挂出一篇论文:《Big Enough to Break Out: Tracking the Rising Capabili...

1100

Grok 4.7进Copilot后,测试团队先别比谁更聪明:先测它会不会把任务做得更危险

霍格沃兹-测试开发学社

模型接入开发工具后,最容易出现一种错觉:代码通过测试,模型就升级成功了。实际上,模型变化可能影响工具选择、修改范围、重试次数、解释方式和成本。

8500

3个Skills把密钥盘点、轮换、撤销串成一条测试流水线

霍格沃兹-测试开发学社

安全团队常见的一句话是:“这批Token应该没人用了。”问题在于,应该不是证据。一个旧PAT可能埋在CI变量、个人脚本、Runner缓存、Agent环境或某个半...

9000

GitHub AI Scan不再依赖CodeQL默认配置:覆盖扩大后,怎么证明漏洞没漏?

霍格沃兹-测试开发学社

摘要:GitHub扩大AI Scan覆盖范围,不再要求仓库启用CodeQL默认配置。本文说明扫描覆盖变广后,如何建立可解释的漏洞样本、误报门禁和仓库级回归。安全...

12400

AI写代码更快了,npm发布权限该怎么收紧?一次讲清stage-only令牌能挡什么

霍格沃兹-测试开发学社

很多团队的发布流水线只有两种状态:要么没有npm令牌,什么也发不了;要么拿着能直接npm publish的令牌,一旦脚本、依赖或Runner被攻破,攻击者就能把...

10300

PR合并后Agent会话自动标记完成:省下的是列表空间,丢掉的可能是事故证据

霍格沃兹-测试开发学社

Agent修完代码、PR合并,会话自动标记Done,过一段宽限期再删除。GitHub 9月18日周更新披露了这项可选预览能力。

4310

Copilot把模型选择变成“效率、平衡、智能”三档:同一套测试还能证明三个档位都可靠吗?

霍格沃兹-测试开发学社

同一个开发者上午让Copilot解释一段代码,下午让它修改支付逻辑。两个任务都选“自动模型”,背后却可能走不同模型、不同推理预算和不同成本路径。

10610

Google 开源 ARTEMIS:AI Agent 如何接管 Android 真机测试?

霍格沃兹-测试开发学社

它不是帮你简单生成几段 Appium 脚本,而是让 AI Agent 直接操作 Android 真机或模拟器:理解自然语言测试任务、识别页面、点击控件、跨 Ap...

12100

RAG 不一定需要大模型重排:Jev 能不能做 Context Filtering?

霍格沃兹-测试开发学社

传统方案会用 Embedding 阈值、Cross-Encoder Reranker,或者再调用一次 LLM 做筛选。

15210

Tool、MCP、Skill 越来越多,Jev 能解决 Agent 路由吗?

霍格沃兹-测试开发学社

但当能力数量变成 50 个、100 个甚至更多,路由本身就开始成为 Agent Harness 的核心问题。

10410

Jev 进入 Agent Guardrail:高风险 Tool Call 该怎么测?

霍格沃兹-测试开发学社

当 Tool Call 开始真正影响外部系统,Guardrail 就不再只是一个“安全功能”,而是必须被系统测试的一条关键链路。

16010

Jev 与概率校准:AI 决策系统该怎么测试?

霍格沃兹-测试开发学社

当 AI 开始直接参与分类、路由、风险判断和业务决策以后,测试工程师要验证的,已经不只是“结果对不对”,还包括:

14110

Jev 发布不到一周,为什么它这么快进入 Agent 工程?

霍格沃兹-测试开发学社

Jev 发布不到一周,已经被 Vercel AI Gateway、LangChain 等 Agent 基础设施快速接入。

24210

秋招项目生成了Python、Java两套SDK,面试时怎样证明它们不是“都能跑,但结果不同”?

霍格沃兹-测试开发学社

摘要:面向应届生设计一个多语言SDK契约测试项目,用黄金向量验证序列化、错误码和流式取消,比单纯生成客户端更能体现测开能力。

13210

相关产品

  • AI测试解决方案

    TAPD AI 测试基于DeepSeek和混元大模型重构测试范式,支持AI一键生成测试用例、智能评审需求。

领券