instinct-benchmock data / v0.1

instinct-bench

Testing the capacities that make agents useful: taste, restraint, context judgment, craft, and control.

made by @gustofied
domains05
tasks24
avg score0.92
best modellaguna-xs-2.1/ 0.92

instinct-bench

Stable tasks for repeatable comparison.

04 domains

Task sets

01
minimum-context / qa24 tasks
variable-context questionsexact + rubric

Trajectories

01
run-0042pass
laguna-xs-2.1 / pool0.92 reward / 7 steps / $0.03

Artifacts

04
task.yaml3.2 KBtask definition
instruction.md1.8 KBagent prompt
trajectory.jsonl84 KBtool + reasoning trace
verifier-report.json6.4 KBreward breakdown
tool-restraintCalling a tool only when it improves the work.coming later
drawingInspecting, repairing, and continuing a partial form.coming later
writingRevising without sanding away the voice.coming later

instinct-bench-live

Recurring tasks drawn from changing conditions.

01 domain
coastal-readingReading current coastal conditions from public observations.coming later