snowflake-labs/data-eng-bench
Coding
Agentic dbt data-engineering benchmark: 103 real-world dbt tasks (analytics, dimensional modeling, incremental models, bug-fixes, snapshots) runnable hermetically on DuckDB or against Snowflake via DB_TYPE. A 30-task balanced fast subset for cost-bounded / CI runs is listed in configs/fast-30.txt.
Run this task
CLI:
inspect eval inspect_harbor/snowflake_labs_data_eng_bench --model openai/gpt-5Python:
from inspect_ai import eval
from inspect_harbor import snowflake_labs_data_eng_bench
eval(snowflake_labs_data_eng_bench(), model="openai/gpt-5")Dataset information
| Harbor registry | snowflake-labs/data-eng-bench |
| Inspect task | snowflake_labs_data_eng_bench |
| Latest digest | sha256:de31878dba7e5a9aad85dc8276820b0a20ab593aed46ff93dfbbbdb6007ec995 |
| Samples | 103 |
| Source | https://github.com/Snowflake-Labs/data-eng-bench |
See Task Parameters for the parameter set shared across all Harbor tasks.