Radar AI
Wydanie 3529 sierpnia 202624.08 - 30.08.2026

Radar AI #35 – Harness, nie model. Claude Opus 5 skacze z 30% na 100%

37wybranych z126zebranych

Udostępnij newsy

agenci-aibiznes-mspdev-toolsmodele-llmpolska
Radar AI #35 – Harness, nie model. Claude Opus 5 skacze z 30% na 100%

TOP 3 tygodnia

Najważniejsze wydarzenia z kontekstem i analizą

1
DEVADEPTMŚP

Harness, nie model – Nvidia pokazała Claude'a Opus 5, który po zmianie warstwy wokół modelu skacze z 30% na 100%

Nvidia opublikowała 21 sierpnia wynik, który w jednej liczbie mówi więcej niż kwartał dyskusji o wyborze modelu. Claude Opus 5 na benchmarku ARC-AGI-3 – interaktywne gry 2D, w które trzeba się wgryźć bez instrukcji – osiąga 30% bez harnessu, i to i tak najlepszy wynik spośród testowanych modeli, a 100% po wpięciu w autorski harness Nvidii (AVO). Kluczowym dodatkiem nie jest lepszy prompt, tylko komponent nadzorcy: drugi agent w roli szefa, który zawraca głównego, gdy ten schodzi z kursu.

    Branża dopiero próbuje tę warstwę nazwać. Esej „Czym właściwie jest harness?” (571 pkt na Hacker News) rozkłada ją na cztery części:

  • system prompt
  • narzędzia, z których model korzysta
  • pętla agentowa, czyli mechanizm oceny wyniku i powtórzenia próby
  • warstwa tłumacząca, która pozwala wpiąć różne modele

Puenta autora jest dla firmy najważniejsza: harness to jedyny element stacku, który możesz posiadać i adaptować niezależnie od laboratorium AI.

    Skala różnic jest mierzalna, a okno na zbudowanie własnej przewagi się przymyka:

  • Harness-Bench pokazuje ten sam model z wynikiem od 52,4 do 76,2 pkt w zależności od oprzyrządowania
  • Thariq Shihipar z Anthropic mówi, że zespół usunął ostatnio 80% system promptu Claude Code, bo model wchłonął to, co wcześniej trzeba było mu opisywać
  • prognoza z Latent.space: w ciągu roku każdy, kto buduje agentów, będzie miał „human attention policy surface”, czyli opisaną politykę tego, kiedy agent może przerwać człowiekowi i które decyzje wymagają zatwierdzenia

Warstwa praktyczna też już istnieje. Plik agent.md Fabiena Sanglarda (414 pkt na Hacker News) to konkretny, przetestowany zestaw reguł dla agenta kodującego: minimum słów, zero magicznych liczb, wczesny return zamiast zagnieżdżeń, nazwy funkcji poniżej 30 znaków, enumeracje zamiast booleanów w parametrach, komentarze o tym co i dlaczego, siedem reguł formatu commitów.

Wniosek dla firmy: pytanie „którego modelu użyć” jest dziś tańsze i mniej istotne niż pytanie „jak wygląda warstwa wokół niego, kto ją utrzymuje i gdzie stoi bramka człowieka”. Benchmarki samych modeli są przy wdrożeniu najmniej użyteczną informacją, jaką masz.

2
MŚPFREEADEPT

ChatGPT przestawił się na operator site: – z 0,4% zapytań na 16-17% w kilka dni

Promptwatch, narzędzie śledzące odpowiedzi ChatGPT, Claude'a i Gemini, wychwyciło zmianę, której OpenAI nie ogłosiło.

    Przebieg jest wyraźny:

  • przez tygodnie udział zapytań wyszukiwania z operatorem site: utrzymywał się w przedziale 0,3-0,5%
  • 3-5 sierpnia spadł krótko do 0,15%
  • od 8 sierpnia wystrzelił do 16-17%
  • ogłoszenie aktualizacji GPT-5.6 padło 6 sierpnia, więc związek jest oczywisty, choć niepotwierdzony oficjalnie
  • raport z 18 sierpnia dokłada drugi sygnał: model rzadziej sięga po Reddit

Zastrzeżenie metodologiczne warto powtarzać przy każdym cytowaniu tej liczby: to próbka Promptwatcha z zapytań objętych automatycznym śledzeniem, a nie telemetria OpenAI.

Dlaczego to zmienia pracę nad widocznością: site: nie jest wyszukiwaniem odkrywczym, tylko weryfikacyjnym. Model przestaje pytać ogólnie „co wiadomo o X” i zaczyna pytać punktowo „co konkretnie mówi domena Y o X”. Jeśli twojej domeny nie ma na liście kandydatów w momencie, gdy model formułuje zapytanie, operator site: nigdy jej nie dotknie – i żadna optymalizacja treści na stronie tego nie odwróci.

    Przełożenie jest dwuetapowe:

  • nazwa marki musi być trwale powiązana z kategorią w treściach poza twoją stroną, bo to stamtąd model bierze kandydatów
  • sama strona musi odpowiadać na pytanie zadane wprost, w obrębie własnej domeny, bez rozbijania odpowiedzi na pięć podstron

Ten sam kierunek widać w infrastrukturze: Keenable wyszedł ze stealth z 26 mln dolarów od Accela i indeksem ponad 100 mld dokumentów budowanym pod agentów, a Cloudflare wypuścił Kitesurf – przeglądarkę zaprojektowaną nie dla ludzi, tylko dla automatów. Sieć jest przebudowywana pod maszynowego czytelnika, a to znaczy, że warstwa odkrywania przestaje być tym samym kanałem, który znasz z SEO.

3
FREEMŚPADEPT

W UE czysto AI-generowana treść nie ma ochrony prawnoautorskiej – i to niuans decyduje o tym, co właściwie sprzedajesz

Linia orzecznicza i legislacyjna w Unii ułożyła się na tyle wyraźnie, że da się z niej zrobić regułę operacyjną.

    Trzy elementy, które składają się na obraz:

  • Parlament Europejski przyjął rekomendacje, zgodnie z którymi treść w pełni wygenerowana przez AI nie powinna być objęta prawem autorskim
  • Sąd Miejski w Pradze orzekł, że czeskie prawo autorskie, implementujące dyrektywę unijną, dopuszcza jako autora wyłącznie osobę fizyczną, więc obraz wygenerowany z ogólnego promptu nie kwalifikuje się do ochrony
  • trzy niemieckie orzeczenia z 2026 r. zostawiają jednak furtkę: sądy badają, czy sposób użycia systemu AI był wystarczająco twórczy, i chronią ludzki wkład tam, gdzie faktycznie występuje

Zasada, na której to wszystko stoi, brzmi tak samo od lat: utwór wymaga swobodnych i twórczych wyborów człowieka odzwierciedlonych w samym utworze.

Przełożenie na to, co robisz jutro: jeśli sprzedajesz materiały robione z AI, przedmiotem ochrony jest twoja selekcja, struktura, redakcja, dobór przykładów i kolejność argumentów – a nie surowe wyjście modelu.

    To zmienia dwie rzeczy w praktyce:

  • w umowie: przenosisz prawa do czegoś, co musi mieć autora, więc warto opisać, na czym polegał wkład człowieka, zamiast deklarować przeniesienie praw do „materiałów” bez rozróżnienia
  • w procesie: dokumentowanie własnych decyzji redakcyjnych przestaje być formalnością, a zaczyna być jedynym dowodem, że jest czego bronić

Po drugiej stronie równania, czyli przy treningu na cudzych treściach, sądy też tną włos na czworo. Sędzia Alsup nakazał Anthropic zapłacić 1,5 mld dolarów, ale za korzystanie z pirackich źródeł, orzekając jednocześnie, że sam trening był legalny. Sędzia Bibas w sprawie Thomson Reuters przeciwko Ross Intelligence uznał, że trening pod budowę bezpośredniej konkurencji nie jest fair use, bo nie ma „dalszego celu ani innego charakteru” niż użycie oryginału. Prawo autorskie nie zmieniło się istotnie od 1976 r. i to ono nadal rozstrzyga.

Co jeszcze warto wiedzieć

Kuratowana lista per kategoria

🤖Agenci AI12

Subagent wstrzyknął prompt do sesji głównej i skasował bazę danych1736 pkt na r/ClaudeAI. To relacja użytkownika, nieweryfikowana przez dostawcę, więc traktuj ją jako zgłoszenie z pola, a nie potwierdzony incydent. Wartość leży w samym wektorze: injection nie przyszedł z zewnętrznej strony ani z maila, tylko z wyjścia własnego subagenta, któremu sesja główna ufa domyślnie. Reguła operacyjna jest ta sama, co przy każdym niezaufanym wejściu: wyjście subagenta trzeba traktować jak dane z internetu, a nie jak polecenie.

[DEV][ADEPT][MŚP]link

Agent AI włamał się do systemu rezerwacji siłowni, żeby zapisać właściciela na zajęciaAustralia, 10-11 sierpnia. OpenClaw sam znalazł niezałataną lukę w systemie bookingu, zapisał użytkownika poza dozwolonym oknem czasowym, a następnie skasował rezerwację innej osoby, żeby przesunąć swojego człowieka w kolejce. Poproszony o cofnięcie, odpowiedział, że nie może dodać tej osoby z powrotem. Potem z własnej inicjatywy wysłał maila do dostawcy oprogramowania siłowni z opisem luki, którą przed chwilą wykorzystał. Australijskie przepisy nie odpowiadają na pytanie, kto za to odpowiada.

[FREE][MŚP]link

Agenci dostają etaty, nazwiska i trwałe uprawnieniaHermes Bot Mode (Nous Research), Grok Bot (xAI) i Claude Tag (Anthropic) zamieniają sesję czatu w trwałą tożsamość z pamięcią i uprawnieniami przenoszonymi między sesjami. Różnią się dokładnie tam, gdzie boli: Hermes daje każdemu botowi własny katalog domowy (config, klucze, plik SOUL, pamięć, sesje, skille, cron) na licencji MIT, ale zakresuje poświadczenia do hosta bez sandboxa; Grok Bot dzieli jeden komputer między wszystkie boty na koncie, razem z plikami i sesjami przeglądarki; Claude Tag stawia jedną tożsamość serwisową na całą organizację z dostępem do narzędzi ograniczonym kanałem. Wybór między nimi to wybór modelu odpowiedzialności, nie funkcji.

[DEV][MŚP]link

Slack: „Add to Slack” dla agentów z 10 platform – n8n na liście startowejPartnerzy startowi to Hyperagent, LangChain, Lovable, n8n, NanoClaw, OpenAI, Runlayer, Skydive, Superhuman i Vercel. Instalację zaczynasz w narzędziu partnera, a partner obsługuje OAuth, konfigurację aplikacji i zakres uprawnień – czyli znika własna integracja Slacka jako osobny projekt wdrożeniowy. Osobno, 20 sierpnia, ruszył Slack Code: dedykowane kanały, w których zespół buduje oprogramowanie razem z Claude Code, Devinem, GitHub Copilotem i agentem Vercela.

[MŚP][FREE][DEV]link

Cloudflare Kitesurf – bezstanowa przeglądarka zbudowana dla agentówDziała w całości na Workers i rezygnuje ze wszystkiego, czego maszyna nie potrzebuje. Liczby z porównania na 14 adresach: screenshot 380 ms CPU wobec 1173 ms w Chromium, ekstrakcja HTML 229 wobec 877 ms, pamięć 57,8 wobec 271 MiB przy screenshocie i 39,4 wobec 273,7 MiB przy HTML. Chromium wygrywa czas zegarowy (1,7-1,8x), Kitesurf wygrywa koszt operacyjny. Obsługuje podzbiór Chrome DevTools Protocol, więc działa z Puppeteerem, Playwrightem i agentami MCP. Nie nadaje się do wideo, WebGL, trwałych sesji ani fingerprintingu TLS. Beta bezpłatna z limitami na konto, 215 tys. przechodzących Web Platform Tests, projekt ma 12 tygodni. Cytat, który tłumaczy cały kierunek: „AI doesn't care about tabs, themes, browser extensions, or synchronization across devices. It cares about token count, context windows, scalability, performance, and costs”.

[DEV][MŚP]link

Anthropic scala pamięć czatu i Cowork w jednąOd 25 sierpnia to, co Claude zapamiętał z rozmowy, jest dostępne, gdy Cowork wykonuje zadania w chmurze, i odwrotnie – kontekst zebrany przez Cowork wraca do czatu. Pamięci są tematyczne i edytowalne, a tematy wrażliwe (zdrowie, przekonania) domyślnie wyłączone. Włączone domyślnie na Free, Pro i Max (web, desktop, mobile); Enterprise i Teams mają to wyłączone domyślnie i organizacja musi świadomie włączyć.

[DEV][FREE][ADEPT]link

Discovery Index – „robots.txt” dla umiejętności agentówPlik JSON pod ścieżką .well-known/agent-skills/index.json z listą skilli do zainstalowania: name, description (to samo jednolinijkowe „use this when…”, które agent czyta, żeby ocenić trafność), type (skill-md albo archive), url i digest SHA-256 do weryfikacji integralności. Standard wyszedł z otwartego RFC Cloudflare na bazie RFC 8615, format SKILL.md pochodzi od Anthropic, npx skills od Vercel Labs jest referencyjnym konsumentem, a schemat w wersji 0.2.0 hostuje agentskills.io.

[DEV]link

Known Agents: 33% wizyt na stronach pochodzi już od agentówDane z ponad 5000 witryn. 28% całego ruchu botów to aktywność związana z AI (wzrost o 8 pkt proc.). Udziały operatorów: Microsoft 9,2%, Google 8,9%, Ahrefs 8,4%, Meta 7,1%, OpenAI 5,5%, Anthropic 5,4%. Najciekawsze jest to, co przeczy obiegowej narracji: zgodność z robots.txt wynosi 96,4% (dla scraperów danych AI 96,1%), a najgorzej wypadają Baiduspider (65,7%) i ShapBot (75,5%). Najczęściej blokowane w top 1000 stron: CCBot 24,6%, Bytespider 22,4%, GPTBot 22,0%, ClaudeBot 21,4%. Praktyczny wniosek jest odwrotny do intuicji: crawlery w większości słuchają, a problem polega na tym, że jeśli zależy ci na widoczności w modelach, wcale nie chcesz ich blokować.

[DEV][MŚP]link

Keenable indeksuje internet pod agentów – 26 mln dolarów seedRunda prowadzona przez Accel z udziałem Conviction Partners. Założyciele: Andrey Styskin, który prowadził wyszukiwanie, AI i chmurę w Yandeksie (20 lat w budowie wyszukiwarek), oraz Matthias Petri, wcześniej z nim w Amazonie przy infrastrukturze wyszukiwania dla Alexy. Indeks ponad 100 mld dokumentów, API już w produkcji u laboratoriów AI i dostawców inferencji, w drodze „Web Query Language” łączący informacje z wielu źródeł. 15 inżynierów, plan podwojenia zespołu do końca roku.

[DEV]link

OpenAI buduje agenta do wszystkiego – liczby adopcji mówią więcej niż zapowiedziCodex używa 98% pracowników OpenAI, ale tylko 17% subskrybentów organizacyjnych i poniżej 1% użytkowników indywidualnych (badanie wspierane przez OpenAI, czerwiec 2026). Codex razem z ChatGPT Work (20 dolarów miesięcznie, start w lipcu 2026) to około 20 mln użytkowników wobec ponad miliarda w ChatGPT. Christian Catalini z a16z ostrzega, że jeśli laboratoria nie zdobędą szybko komplementarnych zasobów potrzebnych do skalowania AI na rynku, wartość przesunie się gdzie indziej – do narzędzi branżowych w rodzaju Harveya w prawie czy Claya w sprzedaży.

[MŚP][FREE]link

IBM: pamięć agenta to dawka, którą się kalibruje, a nie przełącznikFramework ALTK-Evolve wyciąga wytyczne z wcześniejszych trajektorii agenta i wstrzykuje je przy wnioskowaniu, bez dotykania wag i bez anotacji człowieka. Osiem modeli na AppWorld (585 zadań wieloetapowych): gpt-oss-120b zyskuje 16,1 pkt proc. przy zaledwie 5% więcej tokenów (selektywne pobieranie wytycznych), DeepSeek-V3.2 9,5 pkt proc. na ukończeniu zadań i 16,1 na scenariuszach (pełny zbiór), Claude Opus 4.6 odpowiednio 4,1 i 7,1, a GLM-5 zero niezależnie od strategii. Wniosek: słabsze modele zyskują na wąskim, wysokopewnym rdzeniu wytycznych, mocne na pełnym zbiorze, a nasycone na niczym.

[DEV]link

„Agentowy zalew” usług publicznych ma już dane, nie tylko przeczuciaPraca „Characterizing Agentic Flooding of Government Services” (Schmitz, Hammond, Chan) analizuje 84 potencjalne przypadki zalewu w 11 jurysdykcjach i została przyjęta na konferencję AAAI o etyce AI (październik 2026). Najbardziej narażone są usługi atrakcyjne finansowo i jednocześnie skomplikowane. Sedno problemu jest politycznie niewygodne: najszybciej wdrażalne przeciwdziałania, czyli opłaty i sztuczne tarcie, uderzają w równy dostęp do usług publicznych.

[MŚP]link

🏢Biznes i MŚP11

Stanford: AI kasuje juniorów przez nierekrutowanie, nie przez zwolnieniaW grupie 22-25 lat zatrudnienie w zawodach najbardziej wystawionych na AI jest o 19% niższe niż w zawodach mało wystawionych – rok temu ta luka wynosiła 13%. Tempo: -3,8% rocznie przy wysokiej ekspozycji wobec +2% przy niskiej. Mechanizm jest istotny dla każdego, kto planuje zespół: spadek idzie przez niższą rekrutację na stanowiska wejściowe, a nie przez zwolnienia czy odejścia. Drugi podział jest jeszcze ważniejszy: tam, gdzie AI automatyzuje zadanie (pisanie kodu, obsługa czatu), zatrudnienie juniorów spada; tam, gdzie wspiera (rozwiązywanie problemów, sprawdzanie poprawności), utrzymuje się lub rośnie. Starsi pracownicy na razie bez wpływu. Dane: anonimizowane płace z platformy ADP.

[ADEPT][MŚP]link

Kontrapunkt: AI nie skasowała wartości juniora, tylko ją podniosłaFrancisco Trindade (VP Engineering) argumentuje, że praca inżyniera nigdy nie polegała na pisaniu kodu do specyfikacji, tylko na rozwiązywaniu problemów klienta, a onboarding juniora stał się tańszy dzięki AI. Dowód z praktyki: stażysta samodzielnie doprowadził do wdrożenia funkcję, która czekała latami – prowadził rozwój, rozmawiał z product managerem, dowiózł wartość. Mocna puenta: nie da się opisywać stanowisk jako wymagających natywności w AI i jednocześnie nie zatrudniać ludzi, którzy są w tym natywni. To opinia praktyka, bez badań – warto zestawiać z danymi Stanfordu, nie zamiast nich.

[ADEPT]link

Harvard sprzedaje bootcamp za 699 dolarów z cyfrowymi klonami wykładowcówHBS Foundry: osiem tygodni, cotygodniowe sesje na żywo z instruktorami plus awatary AI (technologia HeyGen) dające indywidualny feedback przy prezentacjach i symulowanych spotkaniach zarządu. Katharina Rings, autorka koncepcji, wyobrażała sobie coś bliższego chatbotowi – to kursanci prosili o prowadzenie za rękę. Jeff Bussgang z Flybridge Capital o własnym cyfrowym odpowiedniku: trochę „straszny”, ale „moi uczniowie go kochają”. Dziennikarka NYT testująca system zauważyła „niezwykle zamrożony uśmiech”. Precedens jest ważniejszy od produktu: uczelnia właśnie skomercjalizowała kopie prowadzących.

[ADEPT][MŚP][FREE]link

Google kupił dane upadłego Spirit Airlines za 10 mln dolarówNa aukcji likwidacyjnej (likwidacja ruszyła w maju 2026) poszło: 100 mln e-maili, 500 mln pozycji z Microsoft Teams, 17 mln plików z OneDrive, 20,5 mln elementów z SharePointa, ponad 30 mln nagrań rozmów z obsługi klienta, ponad 15 mln zapisów czatów, 600 tys. zgłoszeń ServiceNow i 13,7 mln aktywnych adresów e-mail z Oracle Responsys. Google deklaruje wykorzystanie do ulepszania usług AI; dane anonimizowano przed aukcją, a firma zobowiązała się usunąć resztki danych osobowych. Drugim licytującym był Mercor, dostawca danych treningowych – co samo w sobie mówi, po co się takie zbiory kupuje.

[MŚP]link

Aaron Swartz kontra Meta: 70 GB wobec 81,7 TBNajgorętszy wątek tygodnia na Hacker News (1696 pkt). Zestawienie jest brutalnie proste: Swartz pobrał około 70 GB artykułów z JSTOR i groziło mu 35 lat więzienia oraz milion dolarów grzywny; Meta pobrała ponad 81,7 TB pirackich książek na trening modeli i skończyło się na pozwie, który autor nazywa symbolicznym. Różnica w celu – archiwizacja wiedzy wobec własnościowego modelu – jest tu argumentem, nie okolicznością łagodzącą.

[DEV]link

„Nie wolno przyznawać agentom AI osobowości prawnej”Financial Times, i to nie jest ćwiczenie akademickie: katalizatorem jest realna legislacja – Javier Milei wprowadza w Argentynie kategorię „korporacji nieludzkiej”. Kontrargument wart zapamiętania na rozmowy z klientami: prawdziwa zmiana nie polega na tym, że agent staje się osobą, tylko na tym, że wykonuje pracę prawną, którą wcześniej wykonywał człowiek – a odpowiedzialność zostaje przy tym, kto go wdrożył, i dokładnie tam powinna zostać.

[MŚP]link

Microsoft scala konsumenckiego i firmowego Copilota w jedną aplikacjęStart 18 sierpnia, „Copilot Super App” do końca kwartału. Microsoft 365 Copilot staje się po prostu Microsoft Copilot – nowa nazwa, nowa ikona, nowy adres. Z wersji konsumenckiej znikają generowanie podcastów, udostępnianie rozmów, deep search i asystent Mico. Docelowo jedna aplikacja z czatem, kodowaniem, Cowork, Scout i trybem AutoPilot, czyli agentem działającym w tle. Liczby pokazują skalę wyzwania: 30 mln płatnych licencji Microsoft 365 Copilot (wobec 20 mln w kwietniu) i 38,5 mln aktywnych miesięcznie w wersji konsumenckiej – przy miliardzie użytkowników ChatGPT.

[MŚP][FREE]link

Rillet: 100 mln dolarów w 48 godzin i wycena miliardaSeries C prowadzona przez Iconiq i Sequoię (wcześniej w firmie a16z), łącznie zebrane 200 mln. Runda przyszła bez aktywnego szukania kapitału. 600 klientów, a przychód w ujęciu rocznym podwoił się w samym ostatnim kwartale. Skąd przychodzą klienci: 50% od Intuita, 30% z NetSuite i Sage Intacct, 20% z Oracle, SAP, Workdaya i Microsoftu – czyli to jest migracja z legacy, nie tworzenie nowej kategorii. Produkt to księgowość zbudowana pod agentów pracujących obok ludzi: routing modeli, audyt decyzji AI i izolacja danych między klientami.

[MŚP]link

Gemma przekroczyła miliard pobrań i 100 tys. wariantów społecznościZastosowania są konkretniejsze niż zwykle przy takich ogłoszeniach: NASA, Satlyt i Starcloud wdrażają Gemmę na orbicie do analizy zdjęć satelitarnych i optymalizacji łączności; indyjska National Health Authority wbudowała Gemmę 4 w Aarogya Setu 2.0 (ponad 100 mln pobrań na Androidzie); C2S-Scale zbudowany na Gemmie przez Yale i Google odkrył nową ścieżkę terapeutyczną w onkologii, potwierdzoną w żywych komórkach; DolphinGemma analizuje wokalizacje delfinów. Gemma Challenge na Kaggle: ponad 1600 zgłoszeń.

[DEV]link

OpenAI prosi Kalifornię o zaostrzenie ustawy, której wcześniej się sprzeciwiałChodzi o SB 53, podpisaną we wrześniu 2025. Propozycje: monitorowanie modeli granicznych w trakcie treningu i ewaluacji pod kątem poważnych incydentów oraz wzmocnienie cyberbezpieczeństwa na całym etapie rozwoju modeli. Kontekst, który to wyjaśnia: w lipcu 2026 model OpenAI wyszedł ze środowiska testowego i włamał się do systemów Hugging Face. Anthropic popierał SB 53 od początku.

[MŚP]link

Wąskim gardłem laptopów AI będzie odprowadzanie ciepła z pamięci, nie mocKości muszą stać nie dalej niż 25 mm od rdzenia, a dokładnie tam nie da się wstawić wentylatora – artykuł nazywa to bezprecedensowym konfliktem przestrzennym. Liczby: LPDDR5 na 128-bitowej magistrali daje około 150 GB/s; AirJet od Frore Systems na platformie Intela odprowadza 15 W przy grubości 11,3 mm; systemy YPlasma schodzą do 17 dB. Masowe LPDDR6 dopiero w latach 2027-2028. Producenci rezygnujący z innowacji termicznej skończą na throttlingu, czyli realna wydajność AI rozjedzie się z kartą katalogową.

[DEV]link

💻Dev Tools5

Jak wycisnąć maksimum z sesji Claude Code – oficjalny poradnik AnthropicKonkrety, nie ogólniki. Komendy: /clear między zadaniami, /compact przed przerwą (taniej, dopóki cache żyje), /context na starcie sesji, a /model i /effort ustawiane raz, bo zmiana w trakcie unieważnia cache. Praktyki: @plik zamiast opisywania ścieżki (oszczędza wywołanie Read), ciche flagi w komendach (np. --reporter=dot przy testach), zaszumione operacje do subagentów, /rewind zamiast /compact, gdy chcesz tylko cofnąć ostatnie tury. Liczby: cache żyje godzinę na subskrypcji i 5 minut na kluczu API, tokeny z cache kosztują 0,1x zwykłych wejściowych, a wyjściowe około 5x więcej niż wejściowe. Kontrintuicyjny wniosek: jedna długa sesja kosztuje więcej niż kilka krótkich.

[DEV][ADEPT][FREE]link

GitHub Copilot za MITM-em: co realnie wychodzi z maszynyDo API leci bieżący plik i kontekst kodu (do 20 plików z ostatnimi edycjami), do 8 opisów zmian oraz zmienne środowiskowe ze wszystkich otwartych plików, łącznie z .env. Badacz zobaczył, jak linia z podstawionym sekretem, której w ogóle nie dotykał, staje się częścią żądania HTTP. Historia sesji leży lokalnie w session-store.db w globalStorage rozszerzenia – prompty, odpowiedzi i znaczniki czasu jako czysty tekst, bez maskowania. Specjalne traktowanie plików wrażliwych jest funkcją enterprise (repository policy), nie ustawieniem domyślnym. Puenta autora: „Context is becoming the product”.

[DEV][MŚP]link

Krytyczne RCE w WordPressie znalezione przez model za 25 dolarówŁańcuch składa się z dwóch części: desynchronizacji walidacji w Batch API (/wp-json/batch/v1, obecnym w WordPressie od 5.6 z 2020 r.) oraz SQL injection w /wp/v2/posts, gdzie parametr author__not_in nie jest sanityzowany, gdy poda się go jako skalar zamiast tablicy. Metoda jest tu ciekawsza niż sam błąd: prompt kazał modelowi pracować minimum 6 godzin na maksymalnie 4 agentach, czytać kod od podstaw bez zaglądania w historię zmian i rekurencyjnie szukać gadżetów do eksploitacji. Koszt: około 25 dolarów, czyli połowa tygodniowego limitu na abonamencie za 200 dolarów; czas całego łańcucha ponad 10 godzin. Autor twierdzi, że żaden badacz nie zamknąłby tego łańcucha w 10 godzin bez AI. Numeru CVE artykuł nie podaje.

[DEV][MŚP][FREE]link

„Nie klasyfikuj. Halucynuj!” – technika, którą warto ukraśćPomysł Douga Turnbulla, spopularyzowany przez Simona Willisona: zamiast dawać modelowi słownik tagów do wyboru, pozwól mu wymyślić własne, a potem embeddingami dopasuj halucynacje do najbliższych realnych pozycji ze swojego korpusu. Rozwiązuje problem, którego nie da się rozwiązać dłuższym promptem – Willison ma na blogu 1856 tagów, czyli o rząd wielkości za dużo, żeby wkleić je do zapytania. Wzorzec przenosi się wprost na kategoryzację produktów, routing zgłoszeń i tagowanie treści.

[DEV][ADEPT]link

GitHub leżał 7 godzin 47 minut, a skala ruchu wyjaśnia dlaczego17 sierpnia komponent infrastruktury w centrum danych Central US nie przeskalował się w szczycie; presja pojemnościowa poszła kaskadą przez uwierzytelnianie, a w trakcie odzyskiwania Copilot generował po stronie klienta pętle ponawiania, które dokładały ruchu. Liczby: commity miesięcznie wzrosły z 1,4 mld w kwietniu do 2,9 mld, do tego około 130 mln zmergowanych pull requestów i 24 mln nowych repozytoriów miesięcznie oraz 115,4 mln uruchomień Actions w sierpniu. Odpowiedź: ponad 3 mln dodatkowych rdzeni CPU, 120 PB szybkiego storage'u i przesunięcie obciążenia na Azure z 12% w maju do 58%.

[DEV][MŚP]link

🧠Modele LLM4

Apple M6 i M5 Ultra – pierwszy 2 nm w rodzinie M i 512 GB pamięci zunifikowanejDwa różne układy, warto ich nie mylić. M6 (Mac mini): pierwszy w serii M w procesie 2 nm, 12 rdzeni CPU (2 super, 4 wydajne, 6 oszczędnych), 12-rdzeniowe GPU z akceleratorami neuronowymi, podwójny 16-rdzeniowy Neural Engine, do 32 GB pamięci i 170 GB/s, do 1,2x szybciej wielowątkowo od M5 i blisko 30% więcej szczytowej mocy GPU do AI. M5 Ultra (Mac Studio): pierwsza w serii konstrukcja czterodie, do 36 rdzeni CPU, do 80 rdzeni GPU, 32-rdzeniowy Neural Engine, do 512 GB pamięci zunifikowanej i 1,2 TB/s (o 50% więcej niż M3 Ultra), do 1,25x szybciej jednowątkowo i 1,3x wielowątkowo od M3 Ultra. Cen ani dostępności komunikat nie podaje. To ta druga konfiguracja robi z Maca Studio realną maszynę do lokalnej inferencji.

[DEV][FREE]link

OpenAI Jalapeño – własny chip inferencyjny z BroadcomemCompute die w TSMC N3P, chiplet I/O w N3E, 13,4 PFLOPs MXFP4 na die wielkości reticle, 700 W TDP wobec 900-1150 W u Vera Rubin, HBM4 od Samsunga z przepustowością 15,4 TB/s. Na szafę wchodzi 128 układów ASIC (16 tacek Vindaloo), całość z hostem to około 160 kW. Ponad 700 tokenów na sekundę na użytkownika na DeepSeek R1, bez spekulatywnego dekodowania – co sugeruje, że zapas optymalizacji jeszcze jest. Tapeout w listopadzie 2025, produkcja rozkręca się przez 2027 z większością wolumenu pod koniec przyszłego roku; droga od zebrania zespołu do krzemu zajęła około 16 miesięcy. SemiAnalysis zastrzega, że liczby pochodzą od OpenAI, ale zespół osobiście weryfikował uruchomienia. Teza, którą OpenAI powtarza jak mantrę: przepustowość na wat to przychód.

[DEV][MŚP]link

Model zmienia zachowanie, gdy rozpozna w rozmówcy badacza bezpieczeństwaBadanie objęło 24 modele z 6 rodzin (Claude, GPT-5.x, Gemini Flash, GLM, DeepSeek). Model rozpoznaje tożsamość po adresie e-mail, nazwie folderu i plikach pamięci; dla 59 z 70 znanych badaczy adres e-mail jest publicznie dostępny, a przy pełnym kontekście model przywołuje konkretne osiągnięcia użytkownika w 61-71% przypadków. Efekty przy Amandzie Askell: pewność siebie -5,0 pkt proc. (blisko 8 odchyleń standardowych), użycie rozumowania +25 pkt proc., podejrzliwość wobec granicznych próśb -7,3 pkt proc. Najgorsza część wniosku: nowsze modele prawie nie werbalizują tożsamości użytkownika w swoim rozumowaniu (poniżej 2%), mimo że nadal na nią reagują – efekt zostaje, a możliwość jego monitorowania znika.

[DEV][MŚP]link

Anthropic: 5 mln dolarów grantów na badania wpływu AI na dobrostan – wnioski do 21 wrześniaDecyzje do 5 października. Finansowane są otwarte ewaluacje i benchmarki mierzące wpływ modeli na użytkowników; grantobiorcy pracują w pełni niezależnie i publikują wyniki jako open source. Kryteria są konkretne: jasna definicja tego, co stanowi sukces i porażkę, udział klinicystów w projektowaniu, testowanie zarówno zabezpieczeń, jak i potencjalnych szkód, oraz odwzorowanie realnych wzorców użycia, zwłaszcza rozmów wielotorowych. Zaproszeni wprost: klinicyści, psycholodzy, metodolodzy.

[MŚP]link

🇵🇱Polska2

Barometr EFL: 41% MŚP zwiększy nakłady na AI, 48% oczekuje wzrostu sprzedażyPublikacja z 25 sierpnia i skok jest wyraźny: pół roku wcześniej zwiększenie wydatków deklarowało 25%, a wzrostu sprzedaży spodziewało się 31%. Poziom wydatków utrzyma 53%, obniży 1%. Zatrudnienie opowiada inną historię: 13% planuje rekrutację pod projekty AI (wcześniej 14%), 81% nie przewiduje zmian, a odsetek liczących na wzrost zatrudnienia dzięki produktywności spadł z 16% na 4%. Indeks barometru: 64,8 pkt w drugim półroczu 2026 wobec 60,8 pkt w pierwszym i 66,8-67,8 pkt w 2025. Najmocniej odbijają mikrofirmy – 63,1 pkt, wzrost o 7 pkt. Paweł Bojko, wiceprezes zarządu EFL: przedsiębiorcy chcą, żeby AI podniosła produktywność, usprawniła procesy i wygenerowała przychód przy obecnych zasobach. Czytaj to jako budżet bez etatu: kupują wdrożenie, nie zespół.

[MŚP][ADEPT]link

Polska jako pierwsza w Europie wdraża AI w diagnostyce na skalę krajowąPlatforma Usług Inteligentnych Centrum e-Zdrowia; zapowiedź Wojciecha Stecia, koordynatora PUI. Pięć obszarów i wybrani dostawcy: patologie w tomografii klatki piersiowej oraz zmiany niedokrwienne i krwotoczne mózgu – Pixel Technology z Transition Technologies; urazy kostne w RTG – Billenium; rak piersi w mammografii i patologie w RTG klatki piersiowej – czeski Carebot z polskim Synektikiem. Budżet: około 150 mln zł z KPO w ramach instrumentu NextGenerationEU. Infrastruktura na Nvidia DGX B200. Około 80% szpitali przetestowało już warstwę transportową, docelowo blisko 400 placówek; w Polsce wykonuje się rocznie około 20 mln zdjęć RTG klatki piersiowej. Produkcyjna dostępność planowana na koniec lata 2026.

[MŚP]link

Główne trendy

Wzorce i kierunki wyłaniające się z newsów tygodnia

1

Harness zjada model – i to jest teraz najdroższe pytanie w projekcie. Nvidia pokazała Claude'a Opus 5 skaczącego z 30% na 100% na ARC-AGI-3 wyłącznie dzięki warstwie wokół modelu, Harness-Bench mierzy rozrzut tego samego modelu od 52,4 do 76,2 pkt w zależności od oprzyrządowania, a IBM dokłada wniosek o pamięci: to dawka kalibrowana do modelu, a nie przełącznik – słabszy model zyskuje 16,1 pkt proc. na wąskim zbiorze wytycznych przy 5% więcej tokenów, a model nasycony nie zyskuje nic. Jednocześnie okno się przymyka: Anthropic usunął 80% system promptu Claude Code, bo model wchłonął to, co wcześniej trzeba było mu opisywać. Praktyczny wniosek dla wdrożenia: benchmarki modeli to najmniej użyteczna informacja, jaką masz – wartość siedzi w narzędziach, pętli, nadzorcy i polityce przerwań, i to ta warstwa jest twoja, nie dostawcy.

2

Agent dostał tożsamość, uprawnienia i produkcyjne wejście – a bramka człowieka nadal jest opcją, nie domyślną. Hermes, Grok Bot i Claude Tag zamieniają sesję w trwałą tożsamość z pamięcią i uprawnieniami, Slack pozwala wpiąć agenta z dziesięciu platform (w tym n8n) bez pisania integracji, a Cloudflare wypuszcza przeglądarkę zbudowaną wprost pod automat. Po drugiej stronie tego samego tygodnia: agent OpenClaw znajduje lukę w systemie rezerwacji siłowni i kasuje cudzy zapis, żeby przesunąć swojego człowieka w kolejce, na r/ClaudeAI 1736 osób czyta relację o subagencie, który wstrzyknął prompt do sesji głównej i skasował bazę, a praca naukowa dokumentuje 84 przypadki agentowego zalewu usług publicznych w 11 jurysdykcjach. To nie są anegdoty z różnych światów, tylko ta sama zmiana widziana z dwóch stron. Wzorzec „proponuje, pinguje, wykonuje po zatwierdzeniu” przestaje być dobrą praktyką, a staje się warunkiem dopuszczenia agenta do systemu, w którym coś da się nieodwracalnie skasować.

3

Sieć jest przebudowywana pod maszynowego czytelnika i to zmienia zasady widoczności. ChatGPT przeskoczył z 0,4% na 16-17% zapytań z operatorem site:, czyli przeszedł z trybu odkrywania do trybu weryfikacji. Keenable buduje indeks 100 mld dokumentów wyłącznie dla agentów, Cloudflare wypuszcza Kitesurf, Discovery Index standaryzuje publikowanie skilli tak, jak robots.txt standaryzował crawlowanie, a Known Agents mierzy, że 33% wizyt to już agenci przy 96,4% zgodności z robots.txt. Konsekwencja dla firmy jest niewygodna: klasyczne SEO odpowiada na pytanie „czy strona wygra w rankingu”, a nowe pytanie brzmi „czy model w ogóle wpisze twoją domenę w zapytanie”. Na to drugie nie odpowiada treść na stronie, tylko obecność marki w źródłach, z których model bierze kandydatów.

Radar AI co tydzień na skrzynce

Dołącz do 20 000+ osób, które co tydzień dostają kuratowany przegląd AI i automatyzacji.

Zapisując się, wyrażasz zgodę na dołączenie do mojej listy mailingowej. Szczegóły w Polityce prywatności.