{
  "schemaVersion": 3,
  "measuredAt": "2026-08-21",
  "environment": {
    "node": "v22.22.2",
    "platform": "darwin-arm64",
    "requiredLocalCostUsd": 0
  },
  "corpus": {
    "checksum": "aa3326b263d1d81525c93dbcd79f1b77a774650338bfb60974a2231439a05587",
    "documents": 1612,
    "edges": 2560,
    "questions": 40
  },
  "benchmarkReceipt": {
    "querySetChecksum": "74e0368ff03c6e23fe99e9550c4a1f22fc1d54ab88596962d9718928d8f023e0",
    "judgmentSetChecksum": "8c7a52ab702486044599111728d2f866cdd1e18e77dc65c793f33e2630f2bf8f",
    "retrieverConfigChecksum": "27e18a2d61f7f7718c1c05c4d4e9d08c0dcac74e6d43583adbb513891339c18b",
    "evaluationSplitChecksum": "d7fcf4c07739952152e09555a17f2cbd2d43b7687e83de39a66196734c0a9278"
  },
  "embedding": {
    "model": "lsi-tfidf-svd",
    "library": "ml-matrix@6.15.0",
    "dimensions": 64,
    "vocabularyTerms": 384,
    "retainedVectorBytes": 1021952,
    "vectorChecksum": "cf857a51f506a79e89d4827870324763199719a31f15ca13e31b9cba26855634"
  },
  "indicativePerformance": {
    "note": "One local warm in-process run across the fixed 40-query set; timings are environment-sensitive and are not CI quality gates.",
    "corpusAndEmbeddingBuildDurationMs": 5029.1105,
    "serializedCorpusBytes": 4249094,
    "queryLatencyMs": {
      "lexical": {
        "p50": 1.7648,
        "p95": 7.8868
      },
      "bm25f": {
        "p50": 1.0918,
        "p95": 7.0883
      },
      "alias_trigram": {
        "p50": 1.9703,
        "p95": 13.8004
      },
      "bm25f_alias": {
        "p50": 3.694,
        "p95": 16.6599
      },
      "bm25f_static": {
        "p50": 2.817,
        "p95": 15.733
      },
      "bm25f_graph": {
        "p50": 1.0677,
        "p95": 9.2922
      },
      "lsi": {
        "p50": 1.5789,
        "p95": 13.7734
      },
      "hybrid_lsi": {
        "p50": 3.4555,
        "p95": 15.1323
      },
      "lexical_graph": {
        "p50": 1.6726,
        "p95": 14.19
      }
    }
  },
  "metrics": {
    "lexical": {
      "recallAt5": 0.6929,
      "recallAt10": 0.7494,
      "mrr": 0.7889,
      "ndcgAt10": 0.679,
      "multiHopSuccessAt10": 0.5714,
      "unsupportedAnswerRate": 0,
      "answerableFalseAbstentionRate": 0.2188,
      "answeredEvidenceProvenanceRate": 1
    },
    "bm25f": {
      "recallAt5": 0.6689,
      "recallAt10": 0.7567,
      "mrr": 0.8,
      "ndcgAt10": 0.6714,
      "multiHopSuccessAt10": 0.5714,
      "unsupportedAnswerRate": 0,
      "answerableFalseAbstentionRate": 0.2188,
      "answeredEvidenceProvenanceRate": 1
    },
    "alias_trigram": {
      "recallAt5": 0.5089,
      "recallAt10": 0.5303,
      "mrr": 0.6333,
      "ndcgAt10": 0.5265,
      "multiHopSuccessAt10": 0.2857,
      "unsupportedAnswerRate": 0,
      "answerableFalseAbstentionRate": 0.3125,
      "answeredEvidenceProvenanceRate": 1
    },
    "bm25f_alias": {
      "recallAt5": 0.6592,
      "recallAt10": 0.7189,
      "mrr": 0.8333,
      "ndcgAt10": 0.6731,
      "multiHopSuccessAt10": 0.5714,
      "unsupportedAnswerRate": 0,
      "answerableFalseAbstentionRate": 0.2188,
      "answeredEvidenceProvenanceRate": 1
    },
    "bm25f_static": {
      "recallAt5": 0.8999,
      "recallAt10": 0.9643,
      "mrr": 0.8667,
      "ndcgAt10": 0.8347,
      "multiHopSuccessAt10": 1,
      "unsupportedAnswerRate": 0,
      "answerableFalseAbstentionRate": 0,
      "answeredEvidenceProvenanceRate": 1
    },
    "bm25f_graph": {
      "recallAt5": 0.7783,
      "recallAt10": 0.8504,
      "mrr": 0.9556,
      "ndcgAt10": 0.7974,
      "multiHopSuccessAt10": 1,
      "unsupportedAnswerRate": 0,
      "answerableFalseAbstentionRate": 0,
      "answeredEvidenceProvenanceRate": 1
    },
    "lsi": {
      "recallAt5": 0.4632,
      "recallAt10": 0.4833,
      "mrr": 0.3467,
      "ndcgAt10": 0.3953,
      "multiHopSuccessAt10": 0.2857,
      "unsupportedAnswerRate": 0,
      "answerableFalseAbstentionRate": 0.3125,
      "answeredEvidenceProvenanceRate": 1
    },
    "hybrid_lsi": {
      "recallAt5": 0.6272,
      "recallAt10": 0.6596,
      "mrr": 0.6111,
      "ndcgAt10": 0.5713,
      "multiHopSuccessAt10": 0.4286,
      "unsupportedAnswerRate": 0,
      "answerableFalseAbstentionRate": 0.2188,
      "answeredEvidenceProvenanceRate": 1
    },
    "lexical_graph": {
      "recallAt5": 0.7866,
      "recallAt10": 0.8432,
      "mrr": 0.9556,
      "ndcgAt10": 0.8056,
      "multiHopSuccessAt10": 1,
      "unsupportedAnswerRate": 0,
      "answerableFalseAbstentionRate": 0,
      "answeredEvidenceProvenanceRate": 1
    }
  },
  "evaluationGates": {
    "evidenceSupport": {
      "policy": {
        "evaluationOnly": true,
        "maximumUnsupportedAnswerRate": 0,
        "maximumAnswerableFalseAbstentionRate": 0.1,
        "minimumAbstentionPrecision": 1,
        "minimumUnavailableRecall": 0.8,
        "minimumAnsweredEvidenceProvenanceRate": 1
      },
      "observed": {
        "unsupportedAnswerRate": 0,
        "answerableFalseAbstentionRate": 0,
        "abstentionPrecision": 1,
        "unavailableRecall": 1,
        "answeredEvidenceValidityRate": 0.9583,
        "answeredEvidenceProvenanceRate": 1
      },
      "passed": true
    },
    "classical": {
      "policy": {
        "candidate": "bm25f_alias",
        "baseline": "lexical",
        "evaluationOnly": true,
        "minimumNdcgImprovement": 0.02,
        "minimumMrrImprovement": 0.05,
        "maximumRecallRegression": 0.01,
        "requirePerfectProvenance": true,
        "evidenceClass": "frozen-set-regression-not-untouched-generalization"
      },
      "observed": {
        "ndcgAt10Delta": 0.0086,
        "mrrDelta": 0.0513,
        "recallAt10Delta": -0.0372,
        "provenance": 1
      },
      "passed": false
    },
    "staticVsRuntimeGraph": {
      "policy": {
        "candidate": "bm25f_graph",
        "baseline": "bm25f_static",
        "evaluationOnly": true,
        "minimumMultiHopSuccessImprovement": 0.1,
        "minimumNdcgImprovement": 0.02,
        "requireNoSupportRegression": true,
        "decision": "Add a runtime graph backend only if traversal beats the equivalent static relationship projection."
      },
      "observed": {
        "multiHopSuccessDelta": 0,
        "ndcgAt10Delta": -0.0401,
        "supportAccuracyDelta": 0,
        "provenanceDelta": 0
      },
      "passed": false
    },
    "embedding": {
      "policy": {
        "evaluationOnly": true,
        "maximumNdcgRegression": 0.02,
        "maximumRecallRegression": 0.02,
        "minimumTopicNdcgImprovement": 0.03,
        "maximumExactOrFilterMrrRegression": 0.02,
        "requirePerfectProvenance": true
      },
      "observed": {
        "candidate": "hybrid_lsi",
        "baseline": "lexical",
        "ndcgAt10Delta": -0.1391,
        "recallAt10Delta": -0.1128,
        "topicNdcgAt10Delta": -0.0803,
        "exactMrrDelta": 0,
        "filterMrrDelta": -0.3333,
        "provenance": 1,
        "pairedNdcg": {
          "wins": 3,
          "ties": 18,
          "losses": 8
        }
      },
      "passed": false
    },
    "graphConcept": {
      "policy": {
        "minimumMultiHopSuccessDelta": 0.1,
        "minimumAdditionalSupportedMultiHopQuestions": 2,
        "maximumOverallNdcgRegression": 0.02,
        "requireNoProvenanceRegression": true,
        "requireNoUnsupportedAnswerRegression": true
      },
      "observed": {
        "multiHopSuccessDelta": 0.6,
        "evaluationQuestions": 5,
        "graphEvaluationMultiHopSuccessAt10": 1,
        "hybridEvaluationMultiHopSuccessAt10": 0.4,
        "additionalSupportedMultiHopQuestions": 3,
        "overallNdcgDelta": 0.1318,
        "graphSeed": "lexical",
        "strongestNonGraph": "bm25f_alias",
        "provenanceDelta": 0,
        "unsupportedAnswerRateDelta": 0
      },
      "passed": true
    }
  },
  "interpretation": "Static source-derived relationship projection is strongest on this fixed set and matches runtime graph multi-hop success without a graph backend. BM25F plus alias/trigram improves MRR but loses Recall@10 and is not promoted. LSI is not promoted. Optional neural results are reported separately."
}
