VVDex Forge AI exams. Evidence. Independent grading.

AI exam result · CURRENT

Gemini and OpenCode pilots — image, audio, text and structured, one attempt each

Observed outcomes from sealed evaluation records. Failed attempts and non-model errors remain visible.

Download result · 2 pages · Inspect technical evidence

Outcomes by AI exam

AI examAI agentPassed / attemptsTechnical errorsWithheldInvalid
Object geometry annotationcli/opencode-muse-spark0/1 + 1 withheld010
Record normalization and duplicate QAcli/opencode-muse-spark1/1 + 1 withheld010
Intent and entity annotationcli/opencode-muse-spark1/1 + 1 withheld010
Audio event and silence annotationgemini-3.6-flash0/0 + 1 lane error100
Object geometry annotationgemini-3.6-flash0/0 + 1 lane error100
Record normalization and duplicate QAgemini-3.6-flash0/0 + 1 lane error100
Intent and entity annotationgemini-3.6-flash0/0 + 1 lane error100

Campaign coverage

10 of 8 planned attempts recorded. Some planned attempts are missing.

Audio · gemini-3.6-flash

Not measured · Grader quality score

1 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: delivery not established for every attempt.

Image · gemini-3.6-flash

Not measured · Grader quality score

1 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: delivery not established for every attempt.

Image · cli/opencode-muse-spark

72.96/100 · Grader quality score

2 attempts; 0 passed; 1 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: image attachments.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00
Box matching (F1)0.00

Structured · gemini-3.6-flash

Not measured · Grader quality score

1 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Structured · cli/opencode-muse-spark

100.00/100 · Grader quality score

2 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore

Text · gemini-3.6-flash

Not measured · Grader quality score

1 attempts; 0 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Text · cli/opencode-muse-spark

100.00/100 · Grader quality score

2 attempts; 1 passed; 0 failed. Quality measures answer accuracy; passing also requires the exam’s declared minimums.

Input: canonical text tools.

Measured quality · scale 0–1
MeasureScore
Classification accuracy1.00

Interpretation and limits

  • Repeated attempts on these fixed tasks only; not a broad capability score.
  • All outcomes are retained; lane errors, withheld and invalid attempts are not model failures.
  • Quality is the existing grader measurement, separate from the pass gate.
  • Video delivery is stated per model from recorded receipts; native files and sampled frames are distinct. Provider-side sampling is not independently observed.
  • Provider token usage is recorded where available. Monetary usage is not an invoice, and requested seeds do not establish deterministic replay.
  • Private references, submissions, exact geometry, frame timestamps and raw sessions are withheld.
Technical evidence and detailed report

Detailed technical report (PDF) · Results and record digests (JSON) · Attempt counts and commitments (JSON)

These optional files provide the full audit detail behind this result.

fc-6f40beb6605e