VVDex Forge AI exams. Evidence. Independent grading.

AI exam result · CURRENT

Free API lanes — text and structured, ten attempts each

Observed outcomes from sealed evaluation records. Failed attempts and non-model errors remain visible.

Download result · 2 pages · Inspect technical evidence

Outcomes by AI exam

AI examAI agentPassed / attemptsTechnical errorsWithheldInvalid
Record normalization and duplicate QA@cf/openai/gpt-oss-20b9/10000
Intent and entity annotation@cf/openai/gpt-oss-20b10/10000
Record normalization and duplicate QAopenai/gpt-oss-20b10/10000
Intent and entity annotationopenai/gpt-oss-20b1/1 + 9 lane errors900
Record normalization and duplicate QAopenai/gpt-oss-120b7/10000
Intent and entity annotationopenai/gpt-oss-120b3/3 + 3 lane errors300
Record normalization and duplicate QAcodestral-latest9/10000
Intent and entity annotationcodestral-latest0/10000
Record normalization and duplicate QAmistral-code-latest9/10000
Intent and entity annotationmistral-code-latest0/10000
Record normalization and duplicate QAministral-14b-latest8/10000
Intent and entity annotationministral-14b-latest0/10000
Record normalization and duplicate QAministral-8b-latest1/10000
Intent and entity annotationministral-8b-latest0/10000

Campaign coverage

136 of 140 planned attempts recorded. Some planned attempts are missing.

Structured · openai/gpt-oss-20b

100.00/100 · Grader quality score

10 attempts; 10 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · openai/gpt-oss-120b

92.50/100 · Grader quality score

10 attempts; 7 passed; 3 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · @cf/openai/gpt-oss-20b

97.50/100 · Grader quality score

10 attempts; 9 passed; 1 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · codestral-latest

97.50/100 · Grader quality score

10 attempts; 9 passed; 1 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · mistral-code-latest

90.00/100 · Grader quality score

10 attempts; 9 passed; 1 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · ministral-14b-latest

87.50/100 · Grader quality score

10 attempts; 8 passed; 2 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · ministral-8b-latest

77.50/100 · Grader quality score

10 attempts; 1 passed; 9 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Text · openai/gpt-oss-20b

100.00/100 · Grader quality score

10 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · openai/gpt-oss-120b

100.00/100 · Grader quality score

6 attempts; 3 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · @cf/openai/gpt-oss-20b

100.00/100 · Grader quality score

10 attempts; 10 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · codestral-latest

50.74/100 · Grader quality score

10 attempts; 0 passed; 10 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · mistral-code-latest

46.39/100 · Grader quality score

10 attempts; 0 passed; 10 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · ministral-14b-latest

66.67/100 · Grader quality score

10 attempts; 0 passed; 10 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · ministral-8b-latest

66.00/100 · Grader quality score

10 attempts; 0 passed; 10 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Interpretation and limits

  • Repeated attempts on these fixed tasks only; not a broad capability score.
  • All outcomes are retained; lane errors, withheld and invalid attempts are not model failures.
  • Quality is the existing grader measurement, separate from the pass gate.
  • Video delivery is stated per model from recorded receipts; native files and sampled frames are distinct. Provider-side sampling is not independently observed.
  • Provider token usage is recorded where available. Monetary usage is not an invoice, and requested seeds do not establish deterministic replay.
  • Private references, submissions, exact geometry, frame timestamps and raw sessions are withheld.
Technical evidence and detailed report

Detailed technical report (PDF) · Results and record digests (JSON) · Attempt counts and commitments (JSON)

These optional files provide the full audit detail behind this result.

fc-3377c49ce724