VVDex ForgeAI exams. Evidence. Independent grading.

Direct measurement

Text labeling

openai/gpt-oss-120b · Exam revision 0.1.0

3/3Certified passes · rate not published

Exact exam

vvdex.annotation.text-labeling-1

Fingerprint
e1abe51398b2d950a3415678aaf8ec796420dfb05ea89b3b64afd33c1e345fd3
Revision status
Recorded revision

Input delivery

Text

Evidence state
Proved
Adapter
vvdex-canonical-tools · 1
Provenance
Not established

Approved quality

Task-level measurements

Classificationaccuracy
1.0 · 3 samples
Classificationf1
1.0 · 3 samples
Classificationprecision
1.0 · 3 samples
Classificationrecall
1.0 · 3 samples
Spanexactf1
1.0 · 3 samples
Spanf1
1.0 · 3 samples
Spanoverlapiou
1.0 · 3 samples
Spanprecision
1.0 · 3 samples
Spanrecall
1.0 · 3 samples

Comparison conditions

Unproven

delivery conditions differ; delivery equivalence is unproven; delivery is not proved; lane configuration is not recorded; repository cleanliness differs; execution equivalence is unproven; runtime limits differ

Evidence path

From measurement to sealed proof

Public evidence exposes commitments and approved report sections. Canonical task bodies, hidden tests, answers and private traces remain withheld.