Objetivo
Comparar cuantitativamente el pipeline de V1 contra el agente de V2, usando
queries reales acumuladas del uso del bot en lugar de un dataset construido
conociendo el corpus.
Contexto
El eval de V1 no discrimina: las cuatro estrategias (vector, BM25, hybrid,
hybrid+rerank) dan cerca de 1.000 en P@k y MRR. La causa está documentada en
learnings.md del 01/06/2026: las 20 preguntas del dataset se escribieron
conociendo los documentos indexados. Es data leakage — el eval mide qué tan
bien recuerda lo que ya se sabía que estaba, no calidad de retrieval.
Desde el 10/08 el bot está en uso real, así que hay queries que no salieron del
corpus. Ese es el insumo.
Criterios de aceptación
Capas afectadas
scripts/eval_retrieval.py o script nuevo
data/samples/ — dataset de queries reales
docs/evaluation_v1_vs_v2.md — nuevo
Decisiones a documentar
Cómo se recolectan las queries del bot. Hoy no hay logging persistente de
las preguntas. Hace falta agregarlo (mínimo: append a un archivo o tabla) antes
de poder recolectar. Esto puede requerir adelantar trabajo de T22.
Qué significa "mejor" acá. V2 va a ser más lento y más caro que V1 por las
llamadas extra. La comparación honesta tiene que decir en qué mejora y a qué
costo, no declarar un ganador.
Objetivo de aprendizaje
Qué es data leakage en evaluación de RAG y cómo se evita en la práctica.
Distinguir métricas offline (dataset fijo) de online (uso real). Entender que
una comparación honesta reporta trade-offs, no ganadores.
Fuera de alcance
LLM-as-judge, RAGAS, Langfuse — todo V3.
Estimación
4h
Depende de
T18 a T23. Es el cierre de V2.
Objetivo
Comparar cuantitativamente el pipeline de V1 contra el agente de V2, usando
queries reales acumuladas del uso del bot en lugar de un dataset construido
conociendo el corpus.
Contexto
El eval de V1 no discrimina: las cuatro estrategias (vector, BM25, hybrid,
hybrid+rerank) dan cerca de 1.000 en P@k y MRR. La causa está documentada en
learnings.mddel 01/06/2026: las 20 preguntas del dataset se escribieronconociendo los documentos indexados. Es data leakage — el eval mide qué tan
bien recuerda lo que ya se sabía que estaba, no calidad de retrieval.
Desde el 10/08 el bot está en uso real, así que hay queries que no salieron del
corpus. Ese es el insumo.
Criterios de aceptación
pregunta tal como se escribió
de recolección
del rerank, pendiente desde el 11/08), número de llamadas al LLM, costo
estimado en tokens
una muestra
docs/evaluation_v1_vs_v2.mdcon resultados, metodología y limitacionesdataset de V3
Capas afectadas
scripts/eval_retrieval.pyo script nuevodata/samples/— dataset de queries realesdocs/evaluation_v1_vs_v2.md— nuevoDecisiones a documentar
Cómo se recolectan las queries del bot. Hoy no hay logging persistente de
las preguntas. Hace falta agregarlo (mínimo: append a un archivo o tabla) antes
de poder recolectar. Esto puede requerir adelantar trabajo de T22.
Qué significa "mejor" acá. V2 va a ser más lento y más caro que V1 por las
llamadas extra. La comparación honesta tiene que decir en qué mejora y a qué
costo, no declarar un ganador.
Objetivo de aprendizaje
Qué es data leakage en evaluación de RAG y cómo se evita en la práctica.
Distinguir métricas offline (dataset fijo) de online (uso real). Entender que
una comparación honesta reporta trade-offs, no ganadores.
Fuera de alcance
LLM-as-judge, RAGAS, Langfuse — todo V3.
Estimación
4h
Depende de
T18 a T23. Es el cierre de V2.