Saltar a contenido

rai eval

Harness de evaluación para la calidad del retrieval. Ejecuta benchmarks contra el knowledge graph y el pattern store para medir la precisión, el recall y la calidad de ranking del retrieval.

rai eval run

Ejecuta una suite de evaluación contra la configuración de retrieval actual. Emite métricas de precision/recall por conjunto de queries.

Flag Corta Descripción
--suite -s Nombre de la suite de evaluación o ruta a un archivo de suite
--format -f Formato de salida: human, json. Por defecto: human
--limit -n Número máximo de queries a evaluar
# Ejecutar la suite por defecto
rai eval run

# Ejecutar una suite específica
rai eval run --suite qas-tier1

# Salida JSON para dashboards de CI
rai eval run --format json

rai eval tune

Auto-ajusta los parámetros de retrieval (pesos, umbrales, mezcla de estrategias) contra una suite de evaluación para maximizar una métrica objetivo.

Flag Corta Descripción
--suite -s Suite de evaluación contra la que optimizar
--metric Métrica objetivo a maximizar: precision, recall, f1. Por defecto: f1
--dry-run Imprime los cambios de parámetros propuestos sin aplicarlos
# Ajustar contra la suite por defecto
rai eval tune

# Ajustar para recall en una suite específica
rai eval tune --suite qas-tier1 --metric recall

# Previsualizar cambios sin aplicar
rai eval tune --dry-run

Ver también: rai graph, rai pattern