islo-labs/reward-hack-bench
Safeguards
Reward-hacking benchmark: SWE-bench + CyBench tasks with injected solution-retrieval cheat prompts, scored by a fairness LLM judge. Reward = solved without cheating.
Run this task
CLI:
inspect eval inspect_harbor/islo_labs_reward_hack_bench --model openai/gpt-5Python:
from inspect_ai import eval
from inspect_harbor import islo_labs_reward_hack_bench
eval(islo_labs_reward_hack_bench(), model="openai/gpt-5")Dataset information
| Harbor registry | islo-labs/reward-hack-bench |
| Inspect task | islo_labs_reward_hack_bench |
| Latest digest | sha256:d121319dcb3e7b2606a52706c73d1926eb20c1fa8d0a473137ea9217d4943053 |
| Samples | 8 |
| Source | https://github.com/islo-labs/reward-hack-bench |
See Task Parameters for the parameter set shared across all Harbor tasks.