DEV Community · Show DEV8/8 00:1056

AI生成政策测试50次,49次覆盖所有边界

I Asked an AI to Author the Same Policy Tests 50 Times. It Hit Every Boundary in 49 Valid Runs.

阅读原文
一项实验测试AI能否独立生成挑战业务决策逻辑的测试用例。研究者将供应商筛选政策(含制裁规则、国家限制、个人数据条件和风险阈值)转换为可执行逻辑,并让AI在不知情的情况下编写测试记录。在50次重复任务中,49次通过预注册检查,全部覆盖6类潜在缺陷,每次生成16条记录,共784条记录均符合政策语义,且每次生成内容不同。尽管结果看似完美,但研究者指出这并非绝对可靠,因为实验仅针对单一提示、模型和合成政策。该研究属于Judgment Pack Specification开源项目,旨在探索AI辅助编写结构化测试用例的可靠性。