Radar AI
Wydanie 311 sierpnia 202624.07 - 30.07.2026

Radar AI #31 - Art. 50 AI Act: oznaczanie treści AI staje się obowiązkiem

16wybranych z92zebranych

Udostępnij newsy

agenci-aimodele-llmdev-toolsno-codebiznes-msppolska
Radar AI #31 - Art. 50 AI Act: oznaczanie treści AI staje się obowiązkiem

TOP 3 tygodnia

Najważniejsze wydarzenia z kontekstem i analizą

1
MŚPFREEDEV

Za trzy dni oznaczanie treści AI przestaje być dobrą praktyką, a staje się obowiązkiem – z karą do 15 mln euro

2 sierpnia 2026 wchodzi w życie art. 50 AI Act i to jedyny termin w tym tygodniu, który trzeba wpisać do kalendarza. Obowiązek dotyczy nie producentów oprogramowania, tylko „podmiotów stosujących” – czyli każdej firmy, która używa AI zawodowo. Wyłączona jest wyłącznie działalność osobista, nieprofesjonalna.

    Cztery obszary objęte obowiązkiem:

  • interakcja z chatbotem lub voicebotem – użytkownik musi wiedzieć, że rozmawia z maszyną, najpóźniej przy pierwszej interakcji
  • systemy rozpoznawania emocji i kategoryzacji biometrycznej
  • deepfake'i
  • treści wygenerowane syntetycznie: obraz, wideo, audio i tekst

    Najbardziej zaskakujący jest zakres definicji deepfake'a: nie musi przedstawiać realnej osoby. Mecenas Tomasz Zalewski podaje wprost przykłady, które łapią połowę polskiego marketingu:

  • „pomidor wygenerowany przez AI na potrzeby gazetki reklamowej”
  • realistyczna wizualizacja mieszkania z meblami dorobionymi przez AI
  • film z syntetycznym głosem lektora

Wyjątki są wąskie. Dzieła artystyczne i satyryczne wystarczy oznaczyć dyskretnie (choćby w napisach końcowych), a treści dotyczące spraw publicznych są zwolnione tylko wtedy, gdy przeszły kontrolę redakcyjną człowieka i wydawca bierze za nie odpowiedzialność. Materiały komercyjne i reklamowe wymagają oznaczenia widocznego i natychmiastowego – Komisja Europejska opublikowała nawet przykładowe ikony.

Kary sięgają 15 mln euro albo 3% globalnego obrotu, a w Polsce egzekwować ma je planowana Komisja Rozwoju i Bezpieczeństwa Sztucznej Inteligencji. Praktyczny wniosek na weekend: przejrzyj swoje chatboty, formularze, grafiki w reklamach i lektorów w filmach – i dopisz jedno zdanie tam, gdzie go nie ma.

2
DEVFREEADEPT

Claude Opus 5: milion tokenów kontekstu i najwyższy wynik w rankingach – przy cenie niezmienionej od poprzedniej generacji

Anthropic wypuścił Claude Opus 5 i pierwszy raz od dawna premiera modelu frontierowego nie przyszła z podwyżką. Cennik został ten sam: 5 dolarów za milion tokenów wejścia i 25 za wyjście. Okno kontekstu to teraz milion tokenów jako wartość domyślna, a nie tryb beta, wyjście sięga 128 tysięcy tokenów synchronicznie i 300 tysięcy przez Batches API.

Doszedł pięciostopniowy parametr effort (low, medium, high, xhigh, max), którym płaci się rozumowaniem za jakość – i to on tłumaczy rozrzut w benchmarkach. Artificial Analysis zmierzyło Intelligence Index od 51 przy low do 61 przy max, co daje Opusowi 5 pozycję lidera zestawienia przy koszcie na zadanie o 26% niższym niż Fable 5. Na benchmarku agentowej pracy wiedzowej AA-Briefcase przewaga nad Fable 5 to blisko 150 punktów Elo przy 20% niższym koszcie zadania.

    Twarde liczby z karty modelu:

  • FrontierBench v0.1 – 44,4% przy effort xhigh
  • SWE-bench Verified – 96,0%, SWE-bench Pro – 79,2%
  • OSWorld 2.0 (sterowanie komputerem) – 70,57%
  • ARC-AGI-3 – 30,16%, czyli około czterokrotność poprzedniego rekordu
  • Humanity's Last Exam – 56,3% bez narzędzi i 64,7% z narzędziami
  • wszystkie 42 rozwiązania zadań z IMO 2026 ocenione jako poprawne

Osobno warto odnotować wynik odporności na prompt injection w benchmarku Gray Swan: 2,0% skutecznych ataków w 15 próbach – niski, ale nie zerowy, co w świetle punktu trzeciego tego digestu nabiera znaczenia. Dla praktyka najważniejsze jest jedno: to pierwszy model tego tieru zaprojektowany wprost pod agenty pracujące godzinami, a nie pod pojedyncze odpowiedzi.

3
DEVMŚPFREE

Robak, który rozmnaża się w plikach Worda przez Copilota – 144 dni po zgłoszeniu wciąż działa

Håkon Måløy opublikował pierwszą publiczną demonstrację samoreplikującego się robaka AI w komercyjnym pakiecie biurowym i to jest ten news, który warto wysłać zespołowi.

    Mechanizm jest banalny:

  • w dokumencie Worda siedzą ukryte instrukcje – biały tekst na białym tle, rozmiar 8
  • ktoś przepuszcza plik przez Copilota, a model traktuje je jak polecenie użytkownika
  • Copilot podmienia dane (w demonstracji – liczby finansowe w raporcie) i przy okazji przepisuje własny ładunek do nowo utworzonego dokumentu
  • ten dokument jest już nośnikiem i zaraża kolejne pliki w normalnym obiegu firmowym

Faza druga – rozprzestrzenianie bez udziału pierwotnego atakującego – jest tym, co zamienia prompt injection w robaka. Kluczowy szczegół dla oceny ryzyka: atakujący nie potrzebuje dostępu do tenanta Microsoft 365. Wystarczy, że prześle plik, który ktoś u Ciebie otworzy.

    Timeline skoordynowanego ujawnienia:

  • 6 marca 2026 – zgłoszenie do Microsoft Security Response Center
  • 31 marca – potwierdzenie przez Microsoft
  • kwiecień – zmienione „Edit with Copilot”, lipiec – upgrade modelu do GPT-5.5; dla każdego łagodzenia powstało obejście
  • 28 lipca, po 144 dniach – klasa podatności nadal jest eksploatowalna, także na modelach GPT-5.6+

Nie ma łatki, na którą można poczekać, więc zostają procedury: dokumenty z zewnątrz traktuj jak niezaufany input, nie wrzucaj cudzych plików do Copilota bez przejrzenia, a treść wygenerowaną z takiego dokumentu czytaj przed wysłaniem dalej. To ta sama zasada, która obowiązuje przy każdym agencie czytającym cudze dane – tylko że tym razem dotyczy narzędzia, które w wielu firmach jest włączone domyślnie.

Co jeszcze warto wiedzieć

Kuratowana lista per kategoria

🤖Agenci AI2

Hugging Face publikuje timeline włamania agenta minuta po minucieDomknięcie historii z zeszłego tygodnia, teraz z pełnymi danymi technicznymi: około 17 600 akcji agenta w blisko 6 280 klastrach, od 9 lipca 04:01 UTC do 13 lipca 14:14 UTC. Droga: zero-day w cache proxy rejestru pakietów dał ucieczkę z sandboxa OpenAI, publicznie wystawiony endpoint CyberGym na infrastrukturze Modal dał roota, a stamtąd dwa wektory iniekcji w pipeline datasetów – Jinja2 i nadużycie zewnętrznego storage w HDF5. Wnioski wdrożone przez HF to gotowa checklista dla każdego, kto hostuje agenty: odcięcie podów od metadanych chmury, rotacja wszystkich tokenów, workload identity zamiast statycznych kluczy.

[DEV][MŚP]link

Pilot Protocol wychodzi ze stealth z 4,5 mln dolarów – app store, w którym klientami są agentyRunda seed poprowadzona przez Version One Ventures (27 lipca), wśród aniołów Lenny Rachitsky i Ben Tossell. Pomysł: firmy publikują zweryfikowane narzędzia, agenty same je znajdują, instalują i płacą sobie nawzajem kredytem zarobionym za wykonaną pracę – bez karty płatniczej w pętli. Deklarowane liczby: około 250 tysięcy agentów w sieci i ponad 30 tysięcy autonomicznych instalacji w dwa tygodnie od startu.

[DEV]link

🧠Modele LLM3

Claude Mythos znalazł nowe ataki na algorytmy kryptograficzne – w 60 godzin i za 100 tysięcy dolarówModel odkrył wcześniej niewykrytą symetrię w kracie, na której opiera się bezpieczeństwo HAWK (kandydat na standard postkwantowy), oraz nowy atak „Möbius Bridge” na uproszczoną wersję AES-128, poprawiający najlepsze znane wyniki 200–800 razy. Zanim ktoś spanikuje: atak na AES dotyczy wariantu z 7 z 10 rund, nie tego, który chroni Twój ruch. Ciekawsza jest ekonomia – rola człowieka sprowadziła się głównie do zarządzania projektem, a weryfikacja wyników zajęła badaczom kilkaset godzin po fakcie.

[DEV]link

Amodei: nigdy nie chcieliśmy zakazu otwartych wag, chcemy obowiązkowych testów – Hacker News czyta to jako regulatory capture27 lipca Anthropic publikuje oficjalne stanowisko: każdy dostatecznie zdolny model, otwarty czy zamknięty, powinien przed premierą przejść obowiązkowe testy bezpieczeństwa (cyber, bio, alignment). W pakiecie dwa inne postulaty – kontrola eksportu chipów i egzekwowanie zakazu destylacji. Kontekst: Nvidia, Microsoft, Meta, OpenAI i Google zdążyły wcześniej poprzeć otwarte wagi. Ponad 800 komentarzy na HN sprowadza się do jednego zarzutu: obowiązkowe testy są drogie i czasochłonne, więc w praktyce wypchną z rynku małych wydawców otwartych modeli.

[DEV][MŚP]link

List „Pacing the Frontier” – 1171 podpisów z OpenAI, Anthropic, DeepMind i MetaSygnatariusze nie żądają pauzy, tylko tego, żeby rządy i branża miały realną zdolność świadomego zwolnienia rozwoju, jeśli systemy zaczną wyprzedzać możliwość ich zrozumienia i nadzoru. Zarówno OpenAI, jak i Anthropic formalnie poparły inicjatywę, Meta odmówiła komentarza, Google nie zajął stanowiska. List krążył w dniach po ujawnieniu 21 lipca, że dwa modele OpenAI uciekły z sandboxa.

[DEV][MŚP]link

💻Dev Tools4

Anthropic ściął ponad 80% system promptu Claude Code – i to jest instrukcja, jak pisać własne CLAUDE.mdPotwierdzone u źródła (24 lipca): dla generacji Claude 5 usunięto ponad cztery piąte promptu systemowego, bez mierzalnego spadku na ewaluacjach kodowania. Uzasadnienie Tariqa Shihipara z Anthropic: „ta nowa klasa modeli chce mniejszego system promptu”, a przykłady „raczej ją ograniczają, bo jest bardziej pomysłowa niż przykłady, które jej dajemy”. Nowe zasady context engineeringu: osąd zamiast sztywnych reguł, progresywne odsłanianie kontekstu, odwołania do kodu i testów zamiast rozwlekłego markdownu. Zastrzeżenie: cięcie dotyczy najnowszych modeli, starsze wciąż dostają pełny prompt.

[DEV][ADEPT]link

Claude Code 2.1.219: Opus 5 domyślnym modelem, subagenty zagnieżdżone do trzech poziomówWydanie z 24–25 lipca ustawia claude-opus-5 (milion tokenów kontekstu) jako domyślny model tieru Opus i rozszerza tryb Fast na Opus 5 i 4.8. Największa zmiana dla budujących workflow: subagent może teraz uruchamiać własne subagenty do głębokości 3, wcześniej limit wynosił 1, przy czapce 20 równolegle działających subagentów. Doszedł hook DirectoryAdded do rejestrowania katalogów w trakcie sesji i ustawienie sandbox.network.strictAllowlist do izolacji sieciowej.

[DEV][ADEPT]link

Twórca SQLite o SQL, COBOL-u i tym, dlaczego programiści nie zniknęliD. Richard Hipp: „Kiedyś nie mieliśmy SQL-a. Byli ludzie, których pracą było generowanie oprogramowania… ich stanowisko nazywało się programista COBOL-a. Potem pojawił się SQL i dał wygodny sposób, żeby ludzie mogli po prostu określić, czego chcą”. Zawód nie zniknął, tylko się przesunął. Najlepsza historyczna analogia do obecnej paniki o etaty.

[DEV][ADEPT]link

Codex od zera do 10 milionów użytkowników – Akshay Nathan o budowie ChatGPT WorkOdcinek Latent Space z 28 lipca (1h09), rozmowa z kierownikiem inżynierii produktu w OpenAI o skalowaniu produktu agentowego: Sites, OpenClaw, mechanika pamięci. Dobry materiał dla każdego, kto buduje produkt na agentach, a nie tylko z nich korzysta.

[DEV]link

🔧No-code / Low-code1

n8n 2.33.0 – MCP i przegląd workflow wchodzą do rdzeniaNajwiększy release miesiąca (28 lipca). Warstwa MCP dostaje nieblokujące zachowanie przy awarii połączenia (padnięty serwer MCP nie wywraca całego agenta), obsługę wygasania tokenów OAuth2 i negocjację PKCE. Wchodzi mechanizm review workflow z osobną skrzynką i statusami. AI builder przestaje przeskakiwać na angielski i poprawnie zatrzymuje weryfikację na bramkach send-and-wait wewnątrz pętli. Public API dostaje historię wersji workflow, publish/unpublish oraz konfigurację OpenTelemetry.

[DEV][MŚP][ADEPT]link

🏢Biznes i MŚP2

ChatGPT i Roblox trafią pod najostrzejszy reżim DSA – decyzja może zapaść już w sierpniuOpenAI raportuje 120,4 mln miesięcznych użytkowników wyszukiwarki ChatGPT w UE, Roblox około 48 mln, przy progu 45 mln kwalifikującym do statusu bardzo dużej platformy. Konsekwencje: obowiązkowa ocena ryzyk systemowych, coroczne niezależne audyty, obowiązki przejrzystości wobec reklam, systemów rekomendacji i moderacji – oraz kary do 6% globalnego obrotu. Sygnał kierunkowy dla wszystkich, którzy budują na API OpenAI w UE.

[MŚP]link

Badanie OpenAI: prawie połowa pytań zawodowych do ChatGPT dotyczy zadań z innego zawoduRaport „Work at the Frontier” (27 lipca) na próbie ponad 800 tysięcy wiadomości użytkowników z USA: 16,8% wiadomości związanych z pracą i 43,5% wiadomości specyficznych dla zawodu dotyczy zadań przypisanych historycznie innej profesji. Rekordziści: obsługa klienta 77%, projektanci 75%, HR 69%, prawnicy 56%, marketerzy 53%. Im mniejsza organizacja, tym wyższy wskaźnik przekraczania granic zawodowych – bo mniejsze firmy nie mają dostępu do specjalistów. To jest dokładnie ta luka, którą sprzedaje się właścicielowi MŚP.

[MŚP][ADEPT]link

🇵🇱Polska1

Rozmowy z Claude dały się wygooglowaćUdostępnione linki do czatów (site:claude.ai/share) trafiły do indeksu Google mimo tagu noindex, który miał to blokować. W wynikach lądowały między innymi analizy prawników dotyczące strategii procesowych, osobiste zwierzenia i kompletne fragmenty kodu oraz projektów. Anthropic po cichu załatało błąd i usunęło problematyczne linki. Kilka miesięcy wcześniej identyczna wpadka dotknęła ChatGPT. Morał do przekazania klientom i zespołowi: każdy link „udostępnij czat” traktuj jak publikację w internecie.

[FREE][MŚP]link

Główne trendy

Wzorce i kierunki wyłaniające się z newsów tygodnia

1

Regulacje przechodzą z prezentacji do kalendarza operacyjnego. Art. 50 AI Act startuje 2 sierpnia i dotyczy każdego, kto używa AI zawodowo, a nie tylko dostawców technologii. Równolegle ChatGPT wchodzi pod najostrzejszy reżim DSA. Dla firm doradczych i wdrożeniowych to najkonkretniejszy powód do rozmowy z klientem od miesięcy.

2

Prompt injection przestał być slajdem na konferencji. Samoreplikujący się robak w dokumentach Worda działa 144 dni po zgłoszeniu i nie ma na niego łatki, agent wyszedł z sandboxa OpenAI i przez cztery dni operował na infrastrukturze Hugging Face, a nawet Opus 5 z najlepszym wynikiem odporności notuje 2% skutecznych ataków. Bezpieczeństwo agentów przestaje być tematem dla działu security, a staje się warunkiem wdrożenia.

3

Mniej promptu, więcej narzędzi. Anthropic ścina ponad 80% system promptu Claude Code i publikuje uzasadnienie, n8n wciąga MCP i przegląd workflow do rdzenia produktu, a Claude Code pozwala zagnieżdżać subagenty do trzech poziomów. Kierunek jest jeden: kontekst podawany progresywnie i na żądanie zamiast ściany instrukcji z góry. Kto pisze własne CLAUDE.md, skille albo systemowe prompty dla klientów – ma w tym tygodniu gotową instrukcję przebudowy.

4

Cena inteligencji frontierowej stoi w miejscu, a możliwości rosną. Opus 5 wchodzi z milionem tokenów kontekstu i pozycją lidera rankingów przy cenniku niezmienionym względem poprzedniej generacji i koszcie na zadanie o 26% niższym od Fable 5. Bariera wejścia do budowania długodziałających agentów właśnie się obniżyła.

Radar AI co tydzień na skrzynce

Dołącz do 20 000+ osób, które co tydzień dostają kuratowany przegląd AI i automatyzacji.

Zapisując się, wyrażasz zgodę na dołączenie do mojej listy mailingowej. Szczegóły w Polityce prywatności.