google-deepmind/terminal-bench-science
Science
Coding
Terminal-Bench Science: 52 expert-level scientific research tasks, flattened from harbor-framework/terminal-bench-science commit 8d2935da4468687477d714e1dd97d5c07688c9b4.
Run this task
CLI:
inspect eval inspect_harbor/google_deepmind_terminal_bench_science --model openai/gpt-5Python:
from inspect_ai import eval
from inspect_harbor import google_deepmind_terminal_bench_science
eval(google_deepmind_terminal_bench_science(), model="openai/gpt-5")Dataset information
| Harbor registry | google-deepmind/terminal-bench-science |
| Inspect task | google_deepmind_terminal_bench_science |
| Latest digest | sha256:4fa7a9af5ecaa4c0c942d4284d32a37d747629c0b288fba796a2c4436b1e965f |
| Samples | 52 |
| Source | https://github.com/harbor-framework/terminal-bench-science |
See Task Parameters for the parameter set shared across all Harbor tasks.