Skip to content
VVVER
Evaluation record / catalog simulationRun 024

Candidate 024 / evaluation record

A simulated AI lab workspace with evaluation history, exact benchmark values, failure sets, and reproducible run context.

Specimen data

This route demonstrates product composition. It does not report a live model, deployed capability, or external benchmark result.
Checkpoints
07
Candidate score
73.6
final
Baseline delta
+9.3
points
Median latency
42
milliseconds

Evaluation trajectory

Candidate and fixed baseline across seven evaluation checkpoints.

Composite score / higher is better
  • Candidate
  • Baseline
Candidate 024 and baseline evaluation trajectory2 series (Candidate, Baseline), 14 plotted observations.5863677276CP-01CP-03CP-05CP-07
View data table
Exact evaluation scores by checkpoint
CheckpointCandidateBaselineDifference
CP-0161.260.4+0.8
CP-0264.861.1+3.7
CP-0366.162.2+3.9
CP-0468.962.8+6.1
CP-0570.463.4+7.0
CP-0672.864.1+8.7
CP-0773.664.3+9.3
The line is deliberately unsmoothed. The disclosure preserves the exact checkpoint record.Source / Catalog calibration set / run 024

Benchmark families

Score / 100
  • Candidate
  • Baseline
Candidate and baseline benchmark families4 categories and 2 grouped series (Candidate, Baseline).0255075100ReasoningRetrievalSafetyLatency
Patterns carry series identity in monochrome and print.Source / Catalog calibration set
Failure-set matrixEach cell includes its exact written score.
MeasureAccuracyStabilityTask fit
Candidate0.910.840.88
Baseline0.820.790.80
Ablation0.760.71

Run record

Dataset
Catalog evaluation set / revision 03
Candidate
024 / fixed checkpoint
Baseline
Reference 011 / frozen
Evaluator
Deterministic specimen protocol
Status
Review ready / not deployed