Harness, nie model – Nvidia pokazała Claude'a Opus 5, który po zmianie warstwy wokół modelu skacze z 30% na 100%
Nvidia opublikowała 21 sierpnia wynik, który w jednej liczbie mówi więcej niż kwartał dyskusji o wyborze modelu. Claude Opus 5 na benchmarku ARC-AGI-3 – interaktywne gry 2D, w które trzeba się wgryźć bez instrukcji – osiąga 30% bez harnessu, i to i tak najlepszy wynik spośród testowanych modeli, a 100% po wpięciu w autorski harness Nvidii (AVO). Kluczowym dodatkiem nie jest lepszy prompt, tylko komponent nadzorcy: drugi agent w roli szefa, który zawraca głównego, gdy ten schodzi z kursu.
- system prompt
- narzędzia, z których model korzysta
- pętla agentowa, czyli mechanizm oceny wyniku i powtórzenia próby
- warstwa tłumacząca, która pozwala wpiąć różne modele
Branża dopiero próbuje tę warstwę nazwać. Esej „Czym właściwie jest harness?” (571 pkt na Hacker News) rozkłada ją na cztery części:
Puenta autora jest dla firmy najważniejsza: harness to jedyny element stacku, który możesz posiadać i adaptować niezależnie od laboratorium AI.
- Harness-Bench pokazuje ten sam model z wynikiem od 52,4 do 76,2 pkt w zależności od oprzyrządowania
- Thariq Shihipar z Anthropic mówi, że zespół usunął ostatnio 80% system promptu Claude Code, bo model wchłonął to, co wcześniej trzeba było mu opisywać
- prognoza z Latent.space: w ciągu roku każdy, kto buduje agentów, będzie miał „human attention policy surface”, czyli opisaną politykę tego, kiedy agent może przerwać człowiekowi i które decyzje wymagają zatwierdzenia
Skala różnic jest mierzalna, a okno na zbudowanie własnej przewagi się przymyka:
Warstwa praktyczna też już istnieje. Plik agent.md Fabiena Sanglarda (414 pkt na Hacker News) to konkretny, przetestowany zestaw reguł dla agenta kodującego: minimum słów, zero magicznych liczb, wczesny return zamiast zagnieżdżeń, nazwy funkcji poniżej 30 znaków, enumeracje zamiast booleanów w parametrach, komentarze o tym co i dlaczego, siedem reguł formatu commitów.
Wniosek dla firmy: pytanie „którego modelu użyć” jest dziś tańsze i mniej istotne niż pytanie „jak wygląda warstwa wokół niego, kto ją utrzymuje i gdzie stoi bramka człowieka”. Benchmarki samych modeli są przy wdrożeniu najmniej użyteczną informacją, jaką masz.

