differential-testing

3 posts

El testing diferencial funciona sin una prueba formal, pero los fallos de modo común son el problema

El testing diferencial te permite encontrar bugs sin conocer la respuesta correcta. El problema es que los errores correlacionados parecen acuerdo. Así es como detectar los puntos ciegos.

Puedes confiar en el testing diferencial sin una prueba formal, pero solo si entiendes exactamente dónde se desmorona. La debilidad se llama common-mode…

¿Y si mis variantes de LLM discrepan? ¿Cuál tiene razón?

Ejecutar múltiples LLMs en paralelo detecta errores que cualquier modelo individual enviaría con total confianza. Así es como construir un sistema de resolución de discrepancias que realmente funciona.

Envías un prompt a GPT-4o. Devuelve un blob JSON con una confianza de 0.97. Envías el mismo prompt a Claude 3.5 Sonnet. Devuelve un blob JSON diferente,…

Cinco implementaciones y ninguna mayoría: cómo elegir realmente la mejor

La programación de N versiones suena simple: ejecutar varias implementaciones y elegir la mejor respuesta. En la práctica, 'mejor' es mucho más difícil de definir que 'más común'.

Tienes cinco implementaciones de la misma función. Tres devuelven el mismo resultado. Una es ligeramente diferente. Una lanza una excepción. ¿Cuál es la…