LoRA-CLF (v0.2.1) del LTV Framework. Clasifica el tipo de una afirmacion (5 categorias
canonicas AVeriTeC) como segundo paso del pipeline de Triage.
Mejoras en v0.2.1
Segundo maestro: re-anotado con gemini-3.5-flash en vez de gemini-3.1-flash-lite.
Mismo pool base, mismos prompts v2, mismos hiperparametros que v0.2.0.
Motivacion: v0.2.0 tuvo precision de Position Statement = 0.12 (categoria de
escape ante duda con Event/Property). El maestro 3.5-flash tambien es mas selectivo
en Task 1 (check-worthy 45.3% vs 65.6% del lite), asi que el pool de entrada a CLF
es mas chico pero mas limpio (3,374 vs 4,879 check-worthy).
Numerical Claim resuelto: recall subio de 0.37 (v0.2.0) a 0.81 manteniendo
precision alta (0.93). En v0.2.0 el modelo reconocia Numerical cuando lo veia pero
perdia el 63% de los casos bajo ruido narrativo; con el maestro 3.5-flash esa
confusion casi desaparecio.
Position Statement — mejora parcial: recall subio de 0.75 a 1.00 (el modelo ya
no deja pasar ningun Position real) y F1 casi se duplico (0.20 -> 0.42). Pero la
precision sigue baja (0.12 -> 0.27): el modelo TODAVIA usa Position como categoria de
escape para E/P dudosos, a la misma tasa que en v0.2.0 (33/159 = 20.8% de los E/P
reales, vs 53/255 = 20.8% en v0.2.0 — identico). Cambiar de maestro mejoro la cobertura
de Position pero no resolvio la frontera E/P-vs-Position en si misma.
Regresion en Quote Verification: recall bajo de 0.76 a 0.59 (17/29 vs 22/29
correctos). De los 12 Quote mal clasificados, 7 se confunden con Position — una
confusion nueva que no era prominente en v0.2.0. A vigilar en v0.2.2.
Causal se mantiene estancado: F1 identico a v0.2.0 (0.53), con mejor precision
(0.64 -> 0.81) pero peor recall (0.45 -> 0.39). 18 de 33 Causal reales se confunden
con Event/Property.
Limitaciones conocidas
La frontera E/P vs Position no se resuelve solo cambiando de maestro: la tasa de
confusion (~21%) es identica en v0.2.0 y v0.2.1. Es el problema mas persistente del
adaptador CLF y el candidato principal para v0.2.2 (razonamiento con checklist
verbalizado) o para oversampling/hard-negatives en v0.3.0.
Dataset sintetico como referencia: las etiquetas provienen de gemini-3.5-flash
con prompts v2 — miden imitacion del maestro, no calidad absoluta.
Eval set mas chico que v0.2.0 (338 vs 488): consecuencia de que el maestro
3.5-flash es mas selectivo en Task 1, reduciendo el pool de check-worthy disponible
para CLF. Las clases minoritarias (Position n=16, Causal n=33) siguen siendo chicas.
Proximo paso
v0.2.2 entrena sobre el mismo maestro y pool pero con razonamiento verbalizado
(el modelo recorre el checklist Quote -> Position -> Causal -> Numerical -> E/P en un
bloque de pensamiento antes de responder). Hipotesis directa: verbalizar el descarte
explicito de cada categoria deberia reducir la confusion E/P-vs-Position que sobrevivio
al cambio de maestro.