Skip to content

[T24] Evaluación V1 vs V2 con queries reales del bot #12

Description

@johnma96

Objetivo

Comparar cuantitativamente el pipeline de V1 contra el agente de V2, usando
queries reales acumuladas del uso del bot en lugar de un dataset construido
conociendo el corpus.

Contexto

El eval de V1 no discrimina: las cuatro estrategias (vector, BM25, hybrid,
hybrid+rerank) dan cerca de 1.000 en P@k y MRR. La causa está documentada en
learnings.md del 01/06/2026: las 20 preguntas del dataset se escribieron
conociendo los documentos indexados. Es data leakage — el eval mide qué tan
bien recuerda lo que ya se sabía que estaba, no calidad de retrieval.

Desde el 10/08 el bot está en uso real, así que hay queries que no salieron del
corpus. Ese es el insumo.

Criterios de aceptación

  • Al menos 20 queries reales extraídas del uso del bot, con la fecha y la
    pregunta tal como se escribió
  • Ninguna query escrita mirando el corpus indexado — documentar el criterio
    de recolección
  • Ambos pipelines corridos sobre las mismas queries
  • Métricas comparadas: latencia extra del agente (nunca se midió el costo
    del rerank, pendiente desde el 11/08), número de llamadas al LLM, costo
    estimado en tokens
  • Al menos una métrica de calidad, aunque sea juicio manual documentado sobre
    una muestra
  • docs/evaluation_v1_vs_v2.md con resultados, metodología y limitaciones
  • Las queries donde V2 falla quedan anotadas como semilla del regression
    dataset de V3

Capas afectadas

  • scripts/eval_retrieval.py o script nuevo
  • data/samples/ — dataset de queries reales
  • docs/evaluation_v1_vs_v2.md — nuevo

Decisiones a documentar

Cómo se recolectan las queries del bot. Hoy no hay logging persistente de
las preguntas. Hace falta agregarlo (mínimo: append a un archivo o tabla) antes
de poder recolectar. Esto puede requerir adelantar trabajo de T22.

Qué significa "mejor" acá. V2 va a ser más lento y más caro que V1 por las
llamadas extra. La comparación honesta tiene que decir en qué mejora y a qué
costo, no declarar un ganador.

Objetivo de aprendizaje

Qué es data leakage en evaluación de RAG y cómo se evita en la práctica.
Distinguir métricas offline (dataset fijo) de online (uso real). Entender que
una comparación honesta reporta trade-offs, no ganadores.

Fuera de alcance

LLM-as-judge, RAGAS, Langfuse — todo V3.

Estimación

4h

Depende de

T18 a T23. Es el cierre de V2.

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

Projects

No projects

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions