userbench/UserBench
Assistants
Coding
UserBench eval: 620 next-message tasks across 62 developers. Composer 2.5 classifies gold and predicted messages into multi-label acts; reward is set Jaccard/IoU.
Run this task
CLI:
inspect eval inspect_harbor/userbench --model openai/gpt-5Python:
from inspect_ai import eval
from inspect_harbor import userbench
eval(userbench(), model="openai/gpt-5")Dataset information
| Harbor registry | userbench/UserBench |
| Inspect task | userbench |
| Latest digest | sha256:5ae6956f943da5d0781cf835cd8025a0411160321bb048f12c77bde7aac46bda |
| Samples | 620 |
See Task Parameters for the parameter set shared across all Harbor tasks.