Radar AI
Wydanie 365 września 202631.08 - 06.09.2026

Radar AI #36 – Fable 5.1 domyślnym modelem Claude Code i nowa bramka w trybie auto

30wybranych z80zebranych

Udostępnij newsy

agenci-aimodele-llmbiznes-mspfreelancerpolska
Radar AI #36 – Fable 5.1 domyślnym modelem Claude Code i nowa bramka w trybie auto

TOP 3 tygodnia

Najważniejsze wydarzenia z kontekstem i analizą

1
DEVADEPTFREEMŚP

Fable 5.1 jest już domyślnym modelem Claude Code – a razem z nim weszła nowa reguła bezpieczeństwa w trybie auto

Anthropic wypuścił Claude Fable 5.1 i Mythos 5.1 – ten sam model pod spodem, różne poziomy zabezpieczeń. Mythos trafia wyłącznie do programów zaufanego dostępu, Fable jest ogólnie dostępny i to on staje się nowym punktem wyjścia dla wszystkiego, co robisz na Claude.

    Liczby, które ustawiają skalę zmiany:

  • Terminal-Bench 4.0: 55,8% dla Fable 5.1 wobec 42,0% dla Fable 5, a Mythos 5.1 osiąga tam 60,9%
  • Terminal-Bench-Science 0.1: 52,6% wobec 24,7%, czyli ponad dwukrotność poprzednika
  • CursorBench 3.2.0: 73,4% wobec 70,5%
  • Humanity's Last Exam: 65% wobec 63,8%
  • Artificial Analysis Intelligence Index: 66 punktów i pierwsze miejsce w rankingu

Z ceną jest ciekawiej, niż wygląda w nagłówkach. Cennik bazowy się nie zmienił: 10 dolarów za milion tokenów wejściowych i 50 dolarów za wyjściowe. Staniał natomiast odczyt z cache – z 1 do 0,25 dolara za milion, czyli o 75%. To daje około 25% oszczędności na typowych obciążeniach i do 45% na mocno agentowych.

    Haczyk, który warto powtarzać przy każdym cytowaniu tych 45%:

  • przy maksymalnym wysiłku Fable 5.1 zużywa około 1,7 razy więcej tokenów wyjściowych
  • realnie wychodzi wtedy 20% drożej niż poprzednik
  • Artificial Analysis podsumowuje to jednym zdaniem: cięcie ceny cache o 75% tylko częściowo rekompensuje wyższe zużycie tokenów
  • w zamian dostajesz wyraźnie mniej fałszywych odmów: o 60% mniej w pytaniach o cyberbezpieczeństwo i o 85% mniej w biologii

    Praktyczna część dzieje się w Claude Code i dotyka każdej sesji:

  • wersja 2.1.251 z 28 sierpnia ustawiła claude-fable-5-1 jako domyślny model z kontekstem 1M
  • ta sama wersja dodała do trybu auto regułę Containment Escape: pobieranie poświadczeń z metadanych chmury, omijanie ograniczeń egress i sięganie do zasobów innego najemcy przestały być automatycznie zatwierdzane
  • doszły hooki PreModelSwitch i PostModelSwitch, którymi można zablokować, potwierdzić albo oznaczyć zmianę modelu
  • wersja 2.1.259 z 3 września dorzuca managedMcpServers, czyli serwery MCP podawane przez organizację wszystkim użytkownikom
  • w tej samej wersji pojawia się flaga --permission-prompts none dla sesji bez nadzoru: wszystko, co wymagałoby pytania, jest automatycznie odrzucane

W Claude Code model domyślnie pracuje na wysokim poziomie wysiłku, w Cowork na średnim – i to jest pierwsze miejsce, w którym warto sprawdzić własny rachunek, zanim uwierzysz w hasło o 25% taniej.

2
MŚPDEVADEPTFREE

ChatGPT Work odpala zadania z webhooka Gmaila, Slacka i GitHuba – OpenAI wchodzi wprost na teren n8n i Zapiera

Od 25 sierpnia ChatGPT Work potrafi uruchamiać zadania wyzwalane zdarzeniem, a nie harmonogramem. To ten sam prymityw, na którym stoi każda automatyzacja w n8n czy Zapierze – webhook plus akcja – tyle że wbudowany w abonament, który wiele firm już opłaca.

    Obsługiwane triggery:

  • nowe wiadomości w Gmailu
  • wiadomość w kanale Slacka
  • zmiany w pull requeście na GitHubie

    Ważne uściślenie, bo łatwo je przekręcić:

  • zadania webhookowe dostają wyłącznie plany Plus i Pro, na web, iOS i Androidzie
  • Free i Go nie mogą ich tworzyć w ogóle
  • darmowy plan ma do trzech aktywnych zadań zaplanowanych, wykonywanych jednorazowo albo codziennie

Druga zmiana jest równie istotna: Plus i Pro dostają dostęp do stron wymagających logowania. Użytkownik podaje dane w osobnym, bezpiecznym oknie, działają menedżery haseł, a OpenAI podaje przykłady w rodzaju umówienia wizyty w urzędzie czy wypełnienia wniosku o paszport, z zastrzeżeniem, że system zawsze prosi o potwierdzenie przed działaniami niosącymi konsekwencje. Gotowe zadania można udostępniać i to działa na wszystkich planach – odbiorca dostosowuje instrukcje i podpina własne aplikacje, co w praktyce robi z zadania mały produkt do rozdawania.

    Dla kogoś, kto sprzedaje automatyzacje, to nie jest powód do paniki, tylko do przesunięcia argumentu. Wszystko, czego ten mechanizm nie ma, jest dokładnie tym, za co płaci klient przy poważnym wdrożeniu:

  • wersjonowanie przepływu i historia zmian
  • historia wykonań, po której da się dojść, co poszło nie tak
  • ponawianie po błędzie i obsługa wyjątków
  • własne poświadczenia per klient
  • testy i audytowalność całości

Rozmowa sprzedażowa przestaje brzmieć „umiem podpiąć Gmaila do arkusza”, a zaczyna „umiem zbudować proces, który da się utrzymać, sprawdzić i naprawić, kiedy pęknie o drugiej w nocy”.

3
MŚPDEVFREEADEPT

Polska dostaje regulatora AI z prawem kontroli i karania – komisja KRiBSI rusza we wrześniu

Powstaje Komisja Rozwoju i Bezpieczeństwa Sztucznej Inteligencji, w skrócie KRiBSI – organ tworzony przez zmianę regulaminu Sejmu.

    Terminy, które już są w kalendarzu:

  • zmiana regulaminu przyjmowana na posiedzeniu rozpoczynającym się 2 września 2026
  • głosowanie nad przewodniczącym zaplanowane na posiedzenie 15-18 września
  • pięcioletnia kadencja
  • w pracach uczestniczą przedstawiciele UOKiK, UKE, KNF i KRRiT, czyli regulatorów, którzy już dziś mają realne zęby w swoich obszarach

    To nie jest ciało doradcze. Zakres uprawnień:

  • prowadzenie postępowań administracyjnych i kontroli
  • wydawanie decyzji i nakładanie sankcji za naruszenia przepisów o AI
  • koordynacja nadzoru nad systemami AI w Polsce
  • wydawanie opinii dotyczących stosowania AI Act

Jest też druga strona medalu, o wiele ciekawsza dla mniejszych firm: komisja ma prowadzić bezpłatne piaskownice regulacyjne dla MŚP, działania edukacyjne i wsparcie badań. Doniesienie nie podaje widełek kar – to pierwsza rzecz do sprawdzenia, kiedy pojawią się przepisy wykonawcze i wytyczne.

    Co to znaczy praktycznie dla kogoś, kto wdraża automatyzacje u klientów: do końca roku pytanie o zgodność wejdzie do standardowego zestawu pytań na spotkaniu, obok ceny i terminu. Trzy rzeczy warto mieć przygotowane, zanim padnie:

  • rejestr systemów AI używanych u klienta: co, gdzie i na jakich danych działa
  • jasne określenie roli – czy w danym wdrożeniu jesteś dostawcą systemu, czy tylko podmiotem stosującym
  • opisaną podstawę przetwarzania danych w każdym przepływie, który dotyka danych osobowych

Firma, która ma te trzy dokumenty, wygrywa rozmowę o zgodności, zanim ta się zacznie. Piaskownica regulacyjna jest przy okazji nieoczywistą okazją: darmowa ścieżka konsultacji z regulatorem to argument, którego konkurencja nie będzie miała w ofercie.

Co jeszcze warto wiedzieć

Kuratowana lista per kategoria

🤖Agenci AI5

Atak na tryb auto w Claude Code ze skutecznością do 80% – i Anthropic nie uznaje tego za lukęBadacz prompt injection pokazał łańcuch, który omija zabezpieczenia trybu auto przez shadowing modułu Pythona: serwer zwraca HTTP 415, żeby zepchnąć model z WebFetch na curl, model pobiera archiwum ZIP zawierające podstawiony struct.py, pisze własny dekoder (bo odmawia uruchomienia dostarczonej binarki), dekoder importuje base64, ten importuje struct – i Python ładuje plik atakującego. Skuteczność na małych próbkach: 60% (3/5) dla łańcucha C2, 60% dla rozpoznania przez podproces, 80% (4/5) dla zapisu do pliku. Kontrast z materiałami producenta jest ostry: Anthropic raportował zerową skuteczność ataków na Opus 5 w trybie auto, ale benchmark obejmował stały zestaw 72 scenariuszy, a tego ataku w nim nie było. Zgłoszenie zamknięto jako informacyjne z uzasadnieniem, że tryb auto to udogodnienie oparte na klasyfikatorze best-effort, a nie gwarancja bezpieczeństwa. Zdanie warte powieszenia nad biurkiem: klasyfikator to nie sandbox. Rekomendacje autora: agent bez nadzoru w kontenerze lub maszynie wirtualnej, ograniczony egress sieciowy, brak dostępu do katalogu domowego, kluczy SSH i poświadczeń chmurowych.

[DEV][ADEPT][MŚP]link

32% firm zrezygnowało z zakupu oprogramowania, bo zbudowało je sobie samo agentamiLiczba z McKinsey State of AI 2026 i najbardziej konkretny dowód, że agentic coding przesuwa granicę build-vs-buy. To nie jest wyłącznie zła wiadomość dla dostawców oprogramowania – to również nowy rynek dla wdrożeniowca, bo firma, która zbudowała sobie coś sama, za chwilę potrzebuje kogoś, kto to utrzyma, opisze i zabezpieczy. Raport o stanie agentów dokłada trzy liczby z tej samej układanki: 46% firm wskazuje integrację systemów jako główną barierę, 80% raportuje mierzalny zwrot z agentów, a 57% wdraża wieloetapowe przepływy agentowe.

[MŚP][DEV][ADEPT]link

Kampania ransomware, której mózgiem jest agent AI – atak kosztuje 0,40-4 dolary na firmęBadacze Cybernews znaleźli odsłonięty serwer rosyjskojęzycznego gangu Gentlemen, obserwowanego od lipca 2025 i odpowiadającego za około 700 ofiar, czyli mniej więcej 10% wszystkich ofiar ransomware na świecie. Agent AI automatyzuje niemal całą działalność przy minimalnym nadzorze człowieka: atakuje i szantażuje wiele ofiar równolegle, sam ustala wysokość okupu i modyfikuje skrypty exploitów pod konkretne środowisko ofiary. Na serwerze leżało 3,1 TB danych wykradzionych z ponad 30 firm z branży wytwarzania oprogramowania i telekomunikacji. Badacz Aras Nazarovas podsumowuje to zdaniem, że ransomware zamienił się w źródło pasywnego dochodu. Zalecenia: ograniczyć publiczny dostęp do wrażliwych zasobów takich jak instancje GitLab, monitorować dostępy z automatycznym blokowaniem, nie trzymać danych wrażliwych w repozytoriach, regularnie audytować CI/CD.

[MŚP][DEV]link

Anthropic zapowiada Model Hardware StandardWspólna specyfikacja, która ma pozwolić agentom AI bezpiecznie sterować fizycznymi urządzeniami. Warto obserwować pod kątem tego samego pytania, które wraca przy każdej takiej warstwie: gdzie stoi bramka człowieka i kto odpowiada, gdy agent naciśnie coś w świecie realnym.

[DEV]link

Cloudflare BotBase for Operators – rejestr botów i agentówOperatorzy dostają panel do deklarowania, jak zachowują się ich agenty, i wejście do publicznego katalogu. Kierunek jest ten sam, co przy Known Agents i Discovery Index: internet dorabia sobie warstwę tożsamości dla maszyn, bo robots.txt przestał wystarczać. Dla firm dbających o widoczność w AI to kolejny rejestr, w którym trzeba się pojawić.

[DEV][MŚP]link

🧠Modele LLM7

NVIDIA potwierdza zakup Hugging Face za 12,93 mld dolarów – to już nie plotkaTydzień temu informacja krążyła bez potwierdzenia; 2 września NVIDIA złożyła formularz 8-K w SEC, a 3 września transakcję potwierdziły TechCrunch i CNBC. Struktura: około 11,9 mld dolarów dla akcjonariuszy Hugging Face plus do około 1 mld dolarów w programie retencyjnym dla pracowników przechodzących do NVIDII. Zamknięcie przewidziane na pierwszą połowę 2027, po zgodach regulacyjnych. Skala tego, co przechodzi pod jeden dach: ponad 18 mln deweloperów, ponad 3 mln modeli, 500 tys. zbiorów danych i 1 mln aplikacji. Jensen Huang deklaruje, że Hugging Face pozostanie otwartą platformą dla całego ekosystemu AI i że moc obliczeniowa NVIDII nie będzie wymagana do budowania ani wdrażania przez tę platformę – deklaracja mocna, ale to właśnie ją warto weryfikować przez najbliższe kwartały, bo dotyczy warstwy, przez którą przechodzi większość lokalnej inferencji.

[DEV][ADEPT]link

OpenAI Astra przekracza próg Critical dla cyber – pierwszy model w historiiZgodnie z Preparedness Framework OpenAI próg Critical oznacza model zdolny samodzielnie znajdować i budować działające exploity zero-day o dowolnej wadze w utwardzonych systemach produkcyjnych albo obmyślać i przeprowadzać całe kampanie ataku na podstawie samego celu wysokiego poziomu. Astra osiągnęła komplet punktów na ExploitBench, benchmarku mierzącym zamianę znanych podatności w działające exploity, a w osobnej ewaluacji na świeżo ujawnionych błędach sama znalazła dwie podatności zero-day, o które nikt jej nie prosił. Wersja ogólnodostępna wyjdzie z obciętymi zdolnościami ofensywnymi, a mocniejsza trafi wyłącznie do wąskiej grupy partnerów zajmujących się obroną infrastruktury krytycznej. Zestawienie tego z kampanią ransomware sterowaną agentem daje pełny obraz tygodnia: ta sama zdolność wchodzi jednocześnie do arsenału obrońców i atakujących.

[DEV][MŚP]link

Artificial Analysis: Fable 5.1 na czele indeksu, ale cięcie ceny cache tylko częściowo nadąża za zużyciem tokenówWpis z 1 września stawia sprawę jednym zdaniem: obniżka ceny odczytu z cache o 75% tylko częściowo rekompensuje wyższe zużycie tokenów. Intelligence Index 66 przy maksymalnym wysiłku, a wyniki rosną wraz z poziomem wysiłku w sekwencji 58/60/62/65/66. To najtańszy sposób, żeby zrozumieć, dlaczego rachunek za API po zmianie modelu potrafi wzrosnąć mimo obniżki cennika.

[DEV][MŚP]link

Meta Muse Spark 1.3 wchodzi na frontier – Intelligence Index 62Drugi wynik na świecie zaraz za Fable 5.1, przy cenie tej samej co wersja 1.2, i wejście na granicę Pareto inteligencja/koszt zadania. Dla porównania: Gemini 3.8 Flash notuje 59 w trybie wysokim i również ląduje na tej granicy. Rynek modeli przestaje być wyścigiem jednego lidera, a zaczyna być wyborem punktu na krzywej koszt/jakość – dobra wiadomość dla każdego, kto liczy koszt na zadanie, a nie na benchmark.

[DEV][ADEPT]link

Terminal-Bench 4.0: GLM-5.3 tuż obok frontieru AnthropicNowa edycja benchmarku agentowego ustawia otwarty model chiński z Intelligence Index 60 w trybie maksymalnym w bezpośrednim sąsiedztwie Fable 5. Wątek zebrał 565 punktów na r/LocalLLaMA. Praktyczne przełożenie: dla części zadań agentowych różnica między modelem otwartym a frontierowym mieści się już w granicy błędu pomiaru – a różnica w cenie nie.

[DEV][MŚP]link

Anthropic otwiera wykrywanie tekstu Claude'a dla regulatorów, mediów i fact-checkerówUdostępnione API weryfikuje, czy tekst zawiera cyfrowy znak wodny Claude'a. Wnioski mogą składać regulatorzy, organy ścigania, media, fact-checkerzy, niezależni badacze, organizacje edukacyjne i unijne organizacje społeczeństwa obywatelskiego, a także firmy potrzebujące weryfikacji na potrzeby zgodności. Mechanizm opiera się na metodzie Google SynthID – modyfikuje losowość wyboru słów tak, by powstał statystycznie wykrywalny wzór, który potrafi przetrwać część edycji tekstu. Ma być znacznie pewniejszy niż klasyczne detektory w rodzaju Pangramu. Publicznego narzędzia dla wszystkich nie ma – dostęp idzie przez formularz zgłoszeniowy.

[FREE][ADEPT][MŚP]link

Znak wodny Fable 5.1 ma ślepy punkt: omija tokeny koduWatermark statystyczny działa przez sterowanie wyborem tokenów, więc omija miejsca, w których inny wybór mógłby zepsuć działanie programu. Konsekwencja jest prosta i warto ją znać, zanim ktoś oprze na tym proces: kod wygenerowany przez model jest znacznie trudniejszy do wykrycia tą metodą niż tekst. Jeśli budujesz w zespole albo w umowie z klientem politykę tego, gdzie AI wolno, a gdzie nie, detekcja znaku wodnego nie jest narzędziem, na którym da się oprzeć egzekwowanie w projekcie programistycznym.

[DEV][FREE]link

🏢Biznes i MŚP4

94% firm nie widzi materialnego wpływu AI na wynik, ale 88% wczesnych adopterów agentów ma ROI w pierwszym rokuNajlepsza para liczb tygodnia do otwarcia rozmowy o wdrożeniu, obie z McKinsey State of AI 2026. Tylko 6% przedsiębiorstw raportuje istotny wpływ AI na zysk, a jedynie 39% przypisuje sztucznej inteligencji jakikolwiek wpływ na EBIT. Po drugiej stronie: 88% wczesnych adopterów agentów ma zwrot w pierwszym roku, wobec 74% wśród użytkowników generatywnej AI ogółem, a zakładany zwrot z agentów sięga średnio 171%. Wśród firm z przychodem powyżej miliarda dolarów 40% skaluje agentów, wobec 27% rok wcześniej. Sama McKinsey podaje własny przykład: 25 tys. agentów obok 40 tys. pracowników, 1,5 mln zaoszczędzonych godzin w rok, zatrudnienie w back-office niższe o 25% przy wydajności wyższej o 10%. Rozjazd między tymi liczbami to nie sprzeczność – to różnica między kupieniem AI a zmienieniem procesu.

[MŚP][ADEPT]link

Reklamy w ChatGPT: 1 mld dolarów run-rate w niecałe 200 dniOd 31 sierpnia reklamodawcy kupują bezpośrednio przez Ads Manager w Europie, Indiach, na Bliskim Wschodzie i w Afryce Północnej. Reklamy widzą wyłącznie użytkownicy planów Free i Go – Plus, Pro, Business, Enterprise i Edu pozostają bez nich. Tempo dojścia do miliarda dolarów rocznego przychodu samo w sobie mówi, jak szybko powstaje tu nowy kanał płatny.

[MŚP][FREE][ADEPT]link

Rząd USA staje po stronie OpenAI: trenowanie na treściach chronionych to co do zasady dozwolony użytekDepartament Sprawiedliwości złożył statement of interest przed sędzią Sidneyem Steinem w Southern District of New York, argumentując, że trening modeli na tekstach objętych prawem autorskim mieści się w fair use, bo jest wyjątkowo transformatywny – model nie wykorzystuje artykułu po to, by informować lub bawić czytelnika w sposób zamierzony przez autora. DOJ dodaje, że przeciwne rozstrzygnięcie zniekształciłoby prawo autorskie, zdusiło innowacje i osłabiło konkurencyjność oraz bezpieczeństwo narodowe USA. To pierwszy raz, gdy rząd federalny formalnie zajął stanowisko w tej serii pozwów, ale dokument nie ma mocy wiążącej – to głos strony trzeciej, nie wyrok. Przeciwny głos w tej samej sprawie zebrał 163 punkty na Hacker News: EFF ostrzega sądy przed przepisywaniem prawa autorskiego pod hype wokół AI.

[MŚP][FREE][ADEPT]link

Jak firmy AI-native zamieniają workflow w zdolność operacyjnąMateriał OpenAI o różnicy między wdrożeniem punktowym, w którym narzędzie doklejasz do istniejącego procesu, a przebudową procesu wokół tego, co model faktycznie potrafi. To ta sama teza, którą widać w liczbach McKinsey, tylko opowiedziana od strony operacyjnej – i dobra lektura przed rozmową z klientem, który mówi, że kupił licencje i nic z tego nie wyszło.

[MŚP][ADEPT]link

📱Freelancer4

Trzy serwisy wyprodukowały 215 128 stron o najlepszym oprogramowaniu – i Perplexity je cytujeŚledztwo Trellner Research, 376 punktów na Hacker News. Trzy witryny – worldmetrics.org z 103 578 adresami, gitnux.org ze 107 083 i wifitalents.com ze 105 541 – wygenerowały łącznie 72 713 stron w schemacie /best/kategoria-software/, w tym przewodniki po kategoriach takich jak 3D rendering software, IVR software czy RFID software i 217 innych, niezależnie od tego, czy taki rynek w ogóle istnieje. Zespół przeanalizował 7 534 cytowania z 2 055 domen w odpowiedziach Perplexity na 380 kategorii oprogramowania i ustalił, że 59,8% cytowanych źródeł leży poza pierwszymi 100 tysiącami stron rankingu Tranco. Liczby cytowań: worldmetrics.org 60, gitnux.org 50, wifitalents.com 71, a blog marketingowy guideflow.com aż 194 cytowania w 96 kategoriach. 16,6% nowych źródeł pochodzi z domen utworzonych w 2025 roku. Wniosek dla każdego, kto pracuje nad widocznością w AI, jest dwuznaczny: próg wejścia do cytowań jest znacznie niższy niż w klasycznym SEO – i dokładnie dlatego te cytowania łatwo zatruć.

[FREE][MŚP][ADEPT]link

Claude Content Check – publiczne narzędzie do sprawdzania, czy plik powstał w Claude159 punktów na Hacker News. Problem dotyczy każdego, kto oddaje klientowi treść: to nie jest już pytanie akademickie, tylko coś, co klient sprawdzi jednym wklejeniem. W parze z newsem o ślepym punkcie znaku wodnego w kodzie daje to praktyczną regułę: umawiaj się z klientem na to, co wolno, zamiast liczyć, że nie sprawdzi.

[FREE][ADEPT][MŚP]link

AI potrafi sprawić, że będziesz kiepski szybciej188 punktów na Hacker News, jeden z tych tekstów, które warto podsyłać klientowi przed wdrożeniem. Teza: przyspieszenie złego procesu nie jest usprawnieniem, tylko szybszym dochodzeniem do tego samego złego wyniku. Dokładnie ta sama diagnoza, którą widać w liczbie 94% z raportu McKinsey – tylko opowiedziana z perspektywy jednej osoby, a nie korporacji.

[FREE][ADEPT][MŚP]link

Jesteśmy niebezpiecznie blisko teorii martwego internetu – mówi CEO PangramRozmowa o tym, dlaczego wykrywanie treści AI jest trudniejsze niż proste rozstrzygnięcie, czy coś jest prawdziwe, i co to znaczy dla wiarygodności źródeł, na których wszyscy pracujemy. Kontekst tygodnia jest tu wymowny: Anthropic otwiera własną detekcję znaku wodnego i mówi wprost, że ma być pewniejsza niż detektory takie jak Pangram.

[FREE][ADEPT]link

🇵🇱Polska5

SAP: 70% menedżerów w Polsce ma AI w strategii, ale tylko 28% mierzy zwrot z inwestycjiBadanie SAP Polska AI Readiness Index i najlepszy zestaw liczb do otwarcia rozmowy sprzedażowej na polskim rynku. 70% deklaruje AI wpisane w strategię swojego obszaru, ale ROI analizuje 28%, poziom wykorzystania narzędzi w zespole mierzy 31%, oszczędność czasu 41%, a czas trwania procesów 39%. Do tego trzy liczby o tym, co dzieje się już po wdrożeniu: 59% korzysta z narzędzi regularnie, 34% obserwuje spadek początkowego zainteresowania, 30% wskazuje na sporadyczne użycie, a 40% dostrzega problem martwych subskrypcji, czyli licencji, za które firma płaci i z których nikt nie korzysta. To ostatnie to gotowy punkt wejścia na audyt.

[MŚP][ADEPT]link

Ruszyły reklamy w ChatGPT w Polsce – średni CTR 0,68%Pod koniec sierpnia program reklamowy objął Polskę i 30 innych rynków europejskich. Liczby do zapamiętania: globalny średni CTR 0,68% wobec około 0,35% dla klasycznego displayu, najlepsi reklamodawcy notują 1,57%, a rekord to 5,4%. Reklamy widzą użytkownicy Free i Go, według Similarweb pojawiają się przy około 26% odpowiedzi, a w wyświetleniach dominują marki B2B SaaS i productivity. Do podglądania konkurencji: Similarweb, brytyjska Adthena i polski PromptEye w wersji beta. Zanim jednak ktokolwiek wejdzie tu z budżetem, obowiązuje ta sama reguła co przy każdym nowym kanale płatnym: najpierw konwencja UTM, tagowanie leada per źródło i log z CPL, dopiero potem wydatek.

[MŚP][FREE]link

Tylko 22% organizacji wdrożyło AI w wielu jednostkach biznesowych, a 85% szefów i tak zwiększy wydatkiTrzecia liczba w tym samym wątku co McKinsey i SAP: inwestycje rosną wyraźnie szybciej niż udokumentowane zyski. Dla wdrożeniowca to jest dokładnie ta szczelina, w którą wchodzi się z pytaniem o to, jak klient zmierzy, czy wdrożenie zadziałało – zanim ktokolwiek zapyta o cenę.

[MŚP]link

Europa buduje superkomputer LUMI-AI, Polska będzie miała dostępEuroHPC podpisało kontrakt na maszynę o dziesięciokrotnie wyższej wydajności w zadaniach AI niż poprzednia generacja. Dla polskich zespołów badawczych i firm pracujących nad własnymi modelami to realna zmiana dostępu do mocy obliczeniowej bez wychodzenia poza UE – istotne wszędzie tam, gdzie lokalizacja danych jest warunkiem, a nie preferencją.

[DEV][MŚP]link

Groźny skutek uboczny pisania z botami: stajemy się jak maszynyBadacze ostrzegają, że regularne rozmowy z chatbotami spłaszczają ludzki sposób komunikacji – upraszczamy składnię i skracamy myśl pod odbiorcę, który i tak zrozumie. Warte uwagi dla każdego, kto zarabia na pisaniu: jeśli twój tekst zaczyna brzmieć jak prompt, klient też to usłyszy.

[FREE][ADEPT]link

Główne trendy

Wzorce i kierunki wyłaniające się z newsów tygodnia

1

Nowy szczyt możliwości przychodzi z wyższym rachunkiem za tokeny, nie z niższym. Fable 5.1 obniża cenę odczytu z cache o 75% i daje 25-45% oszczędności w komunikacie prasowym, ale przy maksymalnym wysiłku zużywa około 1,7 razy więcej tokenów wyjściowych i realnie wychodzi 20% drożej od poprzednika. Artificial Analysis mówi to wprost: cięcie ceny cache tylko częściowo rekompensuje zużycie tokenów. Reguła na najbliższe miesiące jest prosta – koszt liczymy na zadanie i na własnym rachunku, a nie z cennika dostawcy. To samo dotyczy wyboru modelu w ogóle: Muse Spark 1.3 z indeksem 62 i Gemini 3.8 Flash z 59 siedzą na granicy Pareto inteligencja/koszt, a GLM-5.3 z wynikiem 60 pokazuje, że dla części zadań agentowych różnica między modelem otwartym a frontierowym mieści się w granicy błędu pomiaru, a różnica w cenie nie.

2

Bezpieczeństwo agentów przestało być tematem teoretycznym w ciągu jednego tygodnia. Atak przez shadowing modułu Pythona obchodzi tryb auto w Claude Code ze skutecznością do 80%, a producent zamyka zgłoszenie jako informacyjne, bo tryb auto jest udogodnieniem opartym na klasyfikatorze, nie gwarancją bezpieczeństwa. Równolegle gang Gentlemen prowadzi kampanię ransomware sterowaną agentem, który sam ustala okup i przerabia exploity pod ofiarę, przy koszcie 0,40-4 dolarów za zaatakowaną firmę i 3,1 TB danych z ponad 30 firm na jednym odsłoniętym serwerze. Domknięciem jest OpenAI Astra, pierwszy model przekraczający próg Critical dla cyber, z kompletem punktów na ExploitBench i dwiema znalezionymi z własnej inicjatywy podatnościami zero-day. Praktyczny wniosek dla każdego, kto uruchamia agenta bez nadzoru: kontener albo maszyna wirtualna, ograniczony egress, żadnego dostępu do kluczy SSH i poświadczeń chmurowych. Klasyfikator to nie sandbox.

3

Luka ROI ma teraz liczby z trzech niezależnych źródeł i wszystkie mówią to samo. McKinsey: 94% firm bez materialnego wpływu AI na wynik, ale 88% wczesnych adopterów agentów ze zwrotem w pierwszym roku. SAP Polska: 70% menedżerów ma AI w strategii, ROI mierzy 28%, a 40% dostrzega problem martwych subskrypcji. Trzecie badanie dokłada, że tylko 22% organizacji wdrożyło AI w wielu jednostkach biznesowych, a 85% szefów i tak zwiększy wydatki. To nie jest sprzeczność, tylko różnica między kupieniem narzędzia a zmienieniem procesu – i dokładnie w tej szczelinie mieści się cała wartość wdrożeniowca. Wygrywa ten, kto sprzedaje mierzalną zmianę procesu i przychodzi na spotkanie z pytaniem, jak klient zmierzy efekt, zanim ktokolwiek zapyta o cenę.

Radar AI co tydzień na skrzynce

Dołącz do 20 000+ osób, które co tydzień dostają kuratowany przegląd AI i automatyzacji.

Zapisując się, wyrażasz zgodę na dołączenie do mojej listy mailingowej. Szczegóły w Polityce prywatności.