differential-testing

3 posts

Le differential testing fonctionne sans preuve formelle, mais les common-mode failures sont le piège

Le differential testing permet de trouver des bugs sans connaître la réponse correcte. Le problème est que des erreurs corrélées ressemblent à un accord. Voici comment repérer les angles morts.

Vous pouvez faire confiance au differential testing sans preuve formelle, mais seulement si vous comprenez exactement où il s'effondre. La faiblesse s'appelle…

Et si mes variantes de LLM n'étaient pas d'accord ? Laquelle a raison ?

Exécuter plusieurs LLM en parallèle permet de détecter des erreurs que tout modèle isolé enverrait avec assurance. Voici comment construire un système de résolution des désaccords qui fonctionne réellement.

Vous envoyez un prompt à GPT-4o. Il retourne un blob JSON avec un score de confiance de 0,97. Vous envoyez le même prompt à Claude 3.5 Sonnet. Il retourne un…

Cinq implémentations et aucune majorité : comment réellement choisir la meilleure

La programmation N-version a l'air simple : exécuter plusieurs implémentations et choisir la meilleure réponse. En pratique, 'meilleure' est bien plus difficile à définir que 'la plus commune'.

Vous avez cinq implémentations de la même fonction. Trois retournent le même résultat. Une est légèrement différente. Une lève une exception. Laquelle est…