Blueprint-Bench 2
Reconstructs apartment floor plans from sets of interior photos.
Hebbia Financial Services Benchmark
Evaluates finance workflows over dense professional documents.
Internal Research Debugging Evaluation
Diagnoses real bugs from OpenAI research experiments.
KernelGen 1P
Writes and optimizes kernels for OpenAI first-party hardware.
NanoGPT self-improvement evaluation
Improves language-model training under fixed compute and time.