differential-testing

3 posts

Differential testing работает без формального доказательства, но common-mode failures — вот подвох

Differential testing позволяет находить баги, не зная правильного ответа. Проблема в том, что коррелированные ошибки выглядят как согласие. Вот как обнаружить слепые зоны.

Можно доверять differential testing без формального доказательства, но только если точно понимать, где оно даёт сбой. Эта слабость называется common-mode…

Что делать, если мои варианты LLM не согласны? Какой из них прав?

Запуск нескольких LLM параллельно позволяет отлавливать ошибки, которые любая отдельная модель уверенно пропустит. Вот как построить систему разрешения разногласий, которая действительно работает.

Вы отправляете промпт в GPT-4o. Он возвращает JSON с уверенностью 0.97. Вы отправляете тот же промпт в Claude 3.5 Sonnet. Он возвращает другой JSON, тоже с…

Пять реализаций и нет большинства: как на самом деле выбрать лучшую

N-version programming звучит просто: запустить несколько реализаций и выбрать лучший ответ. На практике «лучший» определить гораздо сложнее, чем «самый распространённый».

У вас есть пять реализаций одной и той же функции. Три возвращают одинаковый результат. Одна немного отличается. Одна выбрасывает исключение. Какая из них…