rai eval
Harness de evaluación para la calidad del retrieval. Ejecuta benchmarks contra el knowledge graph y el pattern store para medir la precisión, el recall y la calidad de ranking del retrieval.
rai eval run¶
Ejecuta una suite de evaluación contra la configuración de retrieval actual. Emite métricas de precision/recall por conjunto de queries.
| Flag | Corta | Descripción |
|---|---|---|
--suite |
-s |
Nombre de la suite de evaluación o ruta a un archivo de suite |
--format |
-f |
Formato de salida: human, json. Por defecto: human |
--limit |
-n |
Número máximo de queries a evaluar |
# Ejecutar la suite por defecto
rai eval run
# Ejecutar una suite específica
rai eval run --suite qas-tier1
# Salida JSON para dashboards de CI
rai eval run --format json
rai eval tune¶
Auto-ajusta los parámetros de retrieval (pesos, umbrales, mezcla de estrategias) contra una suite de evaluación para maximizar una métrica objetivo.
| Flag | Corta | Descripción |
|---|---|---|
--suite |
-s |
Suite de evaluación contra la que optimizar |
--metric |
Métrica objetivo a maximizar: precision, recall, f1. Por defecto: f1 |
|
--dry-run |
Imprime los cambios de parámetros propuestos sin aplicarlos |
# Ajustar contra la suite por defecto
rai eval tune
# Ajustar para recall en una suite específica
rai eval tune --suite qas-tier1 --metric recall
# Previsualizar cambios sin aplicar
rai eval tune --dry-run
Ver también: rai graph, rai pattern