大语言模型能建议 Metamorphic Relations,但它们无法保证正确性
大语言模型在发现 test oracles 时是个不错的头脑风暴伙伴,但它们会产生幻觉性质,并遗漏领域约束。以下是如何在不发布虚假测试的前提下使用它们。
你需要测试一个函数,它的正确输出事先无法知道。路由优化器、情感分类器、物理模拟都可以。你读过 metamorphic testing:找到输入和输出之间必须成立的关系,然后测试这些关系而不是精确值。 问题在于如何想出这些关系。你盯着函数签名,脑子里一片空白。 于是你去问大语言模型。它在几秒内就抛出了十条…