google-deepmind/terminal-bench-science

Science
Coding

Terminal-Bench Science: 52 expert-level scientific research tasks, flattened from harbor-framework/terminal-bench-science commit 8d2935da4468687477d714e1dd97d5c07688c9b4.

← Back to Registry

Run this task

CLI:

inspect eval inspect_harbor/google_deepmind_terminal_bench_science --model openai/gpt-5

Python:

from inspect_ai import eval
from inspect_harbor import google_deepmind_terminal_bench_science

eval(google_deepmind_terminal_bench_science(), model="openai/gpt-5")

Dataset information

Harbor registry google-deepmind/terminal-bench-science
Inspect task google_deepmind_terminal_bench_science
Latest digest sha256:4fa7a9af5ecaa4c0c942d4284d32a37d747629c0b288fba796a2c4436b1e965f
Samples 52
Source https://github.com/harbor-framework/terminal-bench-science

See Task Parameters for the parameter set shared across all Harbor tasks.