LoRA-CW (v0.2.1) del LTV Framework. Clasifica si una afirmacion vale la pena ser
verificada periodisticamente (check-worthy). Primer filtro del pipeline de Triage.
Mejoras en v0.2.1
Segundo maestro: re-anotado con gemini-3.5-flash (modelo frontera) en vez de
gemini-3.1-flash-lite. Mismo pool, mismos prompts v2, mismos hiperparametros que
v0.2.0 — la comparacion aisla el efecto del maestro.
Motivacion: v0.2.0 tuvo recall de check-worthy=0.43 (277/488 FN en eval). Analisis
de acuerdo inter-maestro (kappa Task 1 = 0.601 en pilot) mostro que el maestro lite
era sistematicamente mas permisivo en claims triviales/nicho/predictivos que el
prompt v2 pide excluir.
Distribucion mas selectiva: el maestro 3.5-flash marco 45.3% de los 7,440 claims
como check-worthy (vs 65.6% del lite) — mucho mas cerca de lo esperado para un filtro
real de Triage. Por fuente: AVeriTeC 94.9% CW (claims reales de fact-checking) vs
FEVER-family 8.6-18.8% CW (trivia de Wikipedia, correctamente descartada).
Detalles del Entrenamiento
Parametro
Valor
Modelo Base
google/gemma-4-E2B-it
Maestro anotador
gemini-3.5-flash
Max Sequence Length
384
Epochs
1
Batch Size (Per Device)
4
Gradient Accumulation
4
Learning Rate
2e-4
Optimizer
paged_adamw_8bit
Eval set
744 claims (407 No-CW / 337 CW — refleja la distribucion real del maestro)
El problema critico de v0.2.0 esta resuelto: el recall de check-worthy subio de
0.43 a 0.67 (+56% relativo). El adaptador ahora captura 225 de 337 claims
check-worthy en vez de perder 277 de 488 como en v0.2.0. Para un primer filtro de
Triage esto es la metrica que mas importa — dejar pasar claims dudosos es mucho menos
costoso que descartar por error algo que si debia verificarse.
El costo: mas falsos positivos. La precision bajo de 0.78 a 0.54 — el modelo ahora
sobre-marca como check-worthy a claims triviales el 46% de las veces (189/407 FP). El
maestro 3.5-flash rechaza estos casos con mucha claridad (FEVER-family ~85-91% no-CW),
pero el adaptador de 2B, entrenado 1 epoch, no imita esa claridad al 100% — hay perdida
de senal en la destilacion, especialmente en la distincion sutil "trivia de Wikipedia"
vs "afirmacion con relevancia periodistica".
F1 mejora de forma moderada (0.557 -> 0.599, +7.5%) porque la ganancia en recall se
compensa parcialmente con la perdida en precision. El resultado neto es positivo para
el proposito del pipeline (filtro de entrada, no filtro final), pero implica mas carga
de computo en CLF/QA rio abajo procesando claims que en realidad no eran check-worthy.
Limitaciones conocidas
Trade-off recall/precision: v0.2.1 prioriza recall sobre precision respecto a
v0.2.0. Si el volumen de falsos positivos satura CLF/QA en produccion, considerar un
umbral de confianza mas estricto en inferencia en vez de usar la clase binaria directa.
Dataset sintetico como referencia: las etiquetas provienen de gemini-3.5-flash
con prompts v2 — miden imitacion del maestro, no calidad absoluta.
Proximo paso
CW v0.2.1 queda como version de produccion recomendada.