La construcción del dataset y la metodología de entrenamiento, que habían evolucionado de forma ligeramente distinta entre familias de modelos, se unificaron en un único enfoque canónico, auditado frente a fugas. Esto redujo el riesgo de que dos modelos estuvieran siendo comparados silenciosamente bajo dos conjuntos de reglas diferentes.