Naar de inhoud

Hoe de software rond een model heet, en wat ze meetbaar doet.

Hetzelfde taalmodel kan veel beter of veel slechter werk doen, afhankelijk van de software eromheen. De metingen zijn groot, en ze komen met beperkingen die ertoe doen als u erop wilt steunen.

Ahsan Fazal

Oprichter en CEO

Notitie

De naam

De software waarmee een model als agent kan handelen, heeft in drie jaar twee namen gehad. In juli 2023 schreef de evaluatiegroep ARC Evals, nu METR: “We call such programs ‘scaffolding’ and call scaffolding + model combinations ‘agents.’” In 2026 was het woord harness geworden. Anthropic definieert “an agent harness (or scaffold)” in zijn artikel over het evalueren van agents van 9 januari 2026 als het systeem dat “processes inputs, orchestrates tool calls, and returns results”. OpenAI schreef op 11 februari 2026 over harness engineering. Drie preprints van mei en juni 2026 geven een formele definitie; een ervan noemt het “the infrastructure layer that governs context construction, tool interaction, orchestration, and verification around a language model” (Zhang e.a., 7 mei 2026).

Wij gebruiken harness. Wij zochten het woord rig als algemene term voor deze laag en vonden het in geen van deze bronnen. Waar het in AI-⁠gereedschap voorkomt, is het een eigennaam: een Rust-bibliotheek voor LLM-⁠agents en een beveiligingsbedrijf dat op 29 september 2026 van start ging. In één bron over agent-engineering, Gas Town van Steve Yegge, is een rig een project, één git-repository onder aansturing, binnen de harness. Dat is afwezigheid van bewijs, geen bewijs: informeel gebruik kan bestaan waar wij niet keken.

Wat de harness verandert

Anthropic schreef in oktober 2024 dat de prestatie van een agent op SWE-⁠bench “can vary significantly based on this scaffolding, even when using the same underlying AI model”. Later werk zet er getallen bij. Harness-Bench, van 27 mei 2026, draaide zes harnesses op acht modellen over dezelfde 106 taken: de totaalscore van de harnesses liep van 52,4 tot 76,2, dat is 23,8 punten. Een overzichtsartikel van juni 2026 meldt dat op Terminal-Bench 2.0 veertien van de twintig modellen tien punten of meer verschillen naargelang de harness, met een mediane spreiding van 13,6 punten voor één model.

Deze getallen horen hun kanttekeningen naast zich te hebben. De auteurs van Harness-Bench noemen hun resultaten “configuration-level diagnostics, not causal decompositions”: de harnesses draaiden op standaardinstellingen, een deel van de beoordeling gebeurde door een model als rechter, en er is één run per cel en geen significantietoets. In het klassement zijn sommige verschillen opgeblazen door kapotte taken, is één harness op de evaluatieset zelf afgesteld en is valsspelen gedocumenteerd. Alle drie de bronnen zijn preprints, niet collegiaal getoetst.

Wat het niet zegt

“Het model maakt niet het verschil” is de sterke vorm van de bewering, en de bronnen die het effect meten, verwerpen haar. Het overzichtsartikel schrijft dat de benchmark “does not support a harness-only interpretation”. Binnen één harness scoren drie OpenAI-modellen 35,2, 54,0 en 64,7. Harness-Bench vindt dat sterkere modellen hoger scoren en minder verschillen tussen harnesses, en de auteurs concluderen dat capaciteit bij model en harness samen hoort.

Hetzelfde artikel vindt de minste variatie tussen harnesses bij kantoor- en zakelijke communicatietaken. Vragen beantwoorden over de eigen kennis van een organisatie ligt dichter bij die taken dan bij de lange programmeertaken waar de verschillen het grootst zijn. Wij lenen deze verschillen dus niet als bewijs voor Inora. Een eigen meting, op ons soort werk, moet nog komen, en dit is de plek waar zij komt.

Wat wij beweren

Wij zeggen harness, en wij beargumenteren de gemeten vorm: bij een vast model kan de software eromheen het resultaat sterk veranderen, en Axiomatic bouwt die software voor werk waar een fout antwoord gevolgen heeft. Wij beweren niet dat het model er niet toe doet.