VVDex Forge AI exams. Evidence. Independent grading.

AI exam result · CURRENT

Lane pilots — fourteen API lanes and three CLIs on text and structured, one attempt each

Observed outcomes from sealed evaluation records. Failed attempts and non-model errors remain visible.

Download result · 2 pages · Inspect technical evidence

Outcomes by AI exam

AI examAI agentPassed / attemptsTechnical errorsWithheldInvalid
Record normalization and duplicate QA@cf/openai/gpt-oss-20b1/1000
Intent and entity annotation@cf/openai/gpt-oss-20b1/1000
Record normalization and duplicate QAcli/claude-sonnet1/1000
Intent and entity annotationcli/claude-sonnet1/1000
Record normalization and duplicate QAcli/codex1/1000
Intent and entity annotationcli/codex1/1000
Record normalization and duplicate QAopenai/gpt-oss-120b1/1000
Intent and entity annotationopenai/gpt-oss-120b1/1000
Record normalization and duplicate QAcodestral-latest1/1000
Intent and entity annotationcodestral-latest0/1000
Record normalization and duplicate QAminimax/minimax-m3:free1/1000
Intent and entity annotationminimax/minimax-m3:free0/1000
Record normalization and duplicate QAmistral-code-latest1/1000
Intent and entity annotationmistral-code-latest0/1000
Record normalization and duplicate QAnvidia/nemotron-3-super-120b-a12b:free0/0 + 1 withheld010
Intent and entity annotationnvidia/nemotron-3-super-120b-a12b:free1/1000
Record normalization and duplicate QAopenai/gpt-oss-20b1/1000
Intent and entity annotationopenai/gpt-oss-20b0/0 + 1 lane error100
Record normalization and duplicate QAcli/cursor-grok0/0 + 1 invalid001
Intent and entity annotationcli/cursor-grok0/0 + 1 invalid001
Record normalization and duplicate QAcohere/north-mini-code:free0/0 + 1 withheld010
Intent and entity annotationcohere/north-mini-code:free0/0 + 1 withheld010
Record normalization and duplicate QAmagistral-small-latest0/0 + 2 lane errors200
Intent and entity annotationmagistral-small-latest0/0 + 2 lane errors200
Record normalization and duplicate QAministral-14b-latest0/1000
Intent and entity annotationministral-14b-latest0/1000
Record normalization and duplicate QAministral-8b-latest0/1000
Intent and entity annotationministral-8b-latest0/1000
Record normalization and duplicate QAmistral-medium-latest0/0 + 2 lane errors200
Intent and entity annotationmistral-medium-latest0/0 + 2 lane errors200
Record normalization and duplicate QAmistral-small-latest0/0 + 2 lane errors200
Intent and entity annotationmistral-small-latest0/0 + 2 lane errors200
Record normalization and duplicate QAnvidia/nemotron-3-nano-omni-30b-a3b-reasoning:free0/0 + 1 lane error100
Intent and entity annotationnvidia/nemotron-3-nano-omni-30b-a3b-reasoning:free0/0 + 1 lane error100

Campaign coverage

40 of 34 planned attempts recorded. All planned attempts are recorded.

Structured · cli/codex

100.00/100 · Grader quality score

1 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · cli/claude-sonnet

100.00/100 · Grader quality score

1 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · cli/cursor-grok

Not measured · Grader quality score

1 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Structured · mistral-small-latest

Not measured · Grader quality score

2 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Structured · mistral-medium-latest

Not measured · Grader quality score

2 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Structured · magistral-small-latest

Not measured · Grader quality score

2 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Structured · openai/gpt-oss-20b

100.00/100 · Grader quality score

1 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · openai/gpt-oss-120b

100.00/100 · Grader quality score

1 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · codestral-latest

100.00/100 · Grader quality score

1 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · mistral-code-latest

100.00/100 · Grader quality score

1 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · ministral-14b-latest

75.00/100 · Grader quality score

1 attempts; 0 passed; 1 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · ministral-8b-latest

75.00/100 · Grader quality score

1 attempts; 0 passed; 1 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · @cf/openai/gpt-oss-20b

100.00/100 · Grader quality score

1 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · nvidia/nemotron-3-super-120b-a12b:free

Not measured · Grader quality score

1 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Structured · cohere/north-mini-code:free

Not measured · Grader quality score

1 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Structured · minimax/minimax-m3:free

100.00/100 · Grader quality score

1 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Structured · nvidia/nemotron-3-nano-omni-30b-a3b-reasoning:free

Not measured · Grader quality score

1 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Text · cli/codex

100.00/100 · Grader quality score

1 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · cli/claude-sonnet

100.00/100 · Grader quality score

1 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · cli/cursor-grok

Not measured · Grader quality score

1 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Text · mistral-small-latest

Not measured · Grader quality score

2 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Text · mistral-medium-latest

Not measured · Grader quality score

2 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Text · magistral-small-latest

Not measured · Grader quality score

2 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Text · openai/gpt-oss-20b

Not measured · Grader quality score

1 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Text · openai/gpt-oss-120b

100.00/100 · Grader quality score

1 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · codestral-latest

75.00/100 · Grader quality score

1 attempts; 0 passed; 1 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · mistral-code-latest

70.37/100 · Grader quality score

1 attempts; 0 passed; 1 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · ministral-14b-latest

66.67/100 · Grader quality score

1 attempts; 0 passed; 1 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · ministral-8b-latest

60.00/100 · Grader quality score

1 attempts; 0 passed; 1 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · @cf/openai/gpt-oss-20b

100.00/100 · Grader quality score

1 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · nvidia/nemotron-3-super-120b-a12b:free

100.00/100 · Grader quality score

1 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · cohere/north-mini-code:free

Not measured · Grader quality score

1 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Text · minimax/minimax-m3:free

75.00/100 · Grader quality score

1 attempts; 0 passed; 1 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Text · nvidia/nemotron-3-nano-omni-30b-a3b-reasoning:free

Not measured · Grader quality score

1 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Interpretation and limits

  • Repeated attempts on these fixed tasks only; not a broad capability score.
  • All outcomes are retained; lane errors, withheld and invalid attempts are not model failures.
  • Quality is the existing grader measurement, separate from the pass gate.
  • Video delivery is stated per model from recorded receipts; native files and sampled frames are distinct. Provider-side sampling is not independently observed.
  • Provider token usage is recorded where available. Monetary usage is not an invoice, and requested seeds do not establish deterministic replay.
  • Private references, submissions, exact geometry, frame timestamps and raw sessions are withheld.
Technical evidence and detailed report

Detailed technical report (PDF) · Results and record digests (JSON) · Attempt counts and commitments (JSON)

These optional files provide the full audit detail behind this result.

fc-0c7e7c67a231