datacurve/deep-swe-1-1
Coding
DeepSWE 1.1 (point release with isolated verifier environments): measuring frontier coding agents on original, long-horizon engineering tasks.
Run this task
CLI:
inspect eval inspect_harbor/datacurve_deep_swe_1_1 --model openai/gpt-5Python:
from inspect_ai import eval
from inspect_harbor import datacurve_deep_swe_1_1
eval(datacurve_deep_swe_1_1(), model="openai/gpt-5")Dataset information
| Harbor registry | datacurve/deep-swe-1-1 |
| Inspect task | datacurve_deep_swe_1_1 |
| Latest digest | sha256:5affcd534fd90ac85d202d4c63f8b35ddc942140afdd5d60014a21365440a2f5 |
| Samples | 113 |
| Source | https://github.com/datacurve-ai/deep-swe |
See Task Parameters for the parameter set shared across all Harbor tasks.