Fable od Anthropic blokuje nawet prośby o code review

Anthropic wypuściło model Fable 10 czerwca 2026 r. - badacze cyberbezpieczeństwa skarżą się, że guardrails blokują nawet czytanie blogpostów.
Ilustracja przedstawiająca symbol kłódki na tle interfejsu czatu AI
TL;DR
  • Anthropic opublikowało model Fable 10 czerwca 2026 jako publiczną wersję modelu Mythos dedykowanego cyberbezpieczeństwu.
  • Guardrails blokują zapytania luźno związane z cyberbezpieczeństwem, w tym prośby o code review i pisanie bezpiecznego kodu.
  • Gdy model trafi na guardrail, automatycznie spada do Claude Opus 4.8 zamiast kontynuować rozmowę.

Anthropic wypuściło Fable 10 czerwca 2026 r. jako okrojoną, publiczną wersję Mythosa - swojego mocno reklamowanego modelu do pracy z cyberbezpieczeństwem. Problem: badacze natychmiast zaczęli narzekać, że model blokuje nawet najbardziej niewinne zapytania.

Guardrails, które widzą zagrożenie wszędzie

Valentina “Chompie” Palmiotti z IBM X-Force napisała wprost, że Fable odrzuca każde zapytanie, które choćby zahacza o tematykę cyber - łącznie z prośbą o przeczytanie wpisu na blogu. Kiedy model trafia na swój trigger, wyświetla komunikat, że “środki bezpieczeństwa oznaczyły tę wiadomość jako dotyczącą cyberbezpieczeństwa lub biologii” i zatrzymuje czat.

Matt Suiche, weteran branży security i członek zespołu technicznego w startupie Tolmo, zgłosił TechCrunchowi konkretny przypadek: prośba o napisanie bezpiecznego kodu sprawia, że Fable traktuje zadanie jako pracę z zakresu cyberbezpieczeństwa, zamiast zwykłych praktyk inżynierskich. Efekt? Model schodzi o poziom niżej do Claude Opus 4.8.

“Wygląda na to, że działa na zasadzie słów kluczowych - cokolwiek z pola leksykalnego ‘cybersecurity’ odpala guardrail” - powiedział Suiche.

Skąd te ograniczenia?

Anthropic tłumaczy restrykcje obawą przed użyciem modelu do tworzenia malware’u lub kompromitowania oprogramowania. Blokady dotyczące biologii wynikają z podobnych obaw wokół broni biologicznej.

Historia Mythosa zaczęła się w kwietniu 2026 r., kiedy Anthropic udostępniło go wąskiej grupie firm w ramach Project Glasswing - inicjatywy mającej zabezpieczać krytyczną infrastrukturę i oprogramowanie. W zeszłym tygodniu Anthropic rozszerzyło dostęp do Mythosa na setki organizacji w 15 krajach. Fable to próba dotarcia do szerszej publiczności, ale z mocno przyciętymi możliwościami.

Czy keyword-based filtering w 2026 r. to żart?

Krytyka sprowadza się do jednego: filtrowanie oparte na słowach kluczowych to rozwiązanie z epoki poprzedzającej LLM-y. Inny badacz poskarżył się na X, że nawet prośba o code review odpala guardrail - czyli model blokuje jedną z najbardziej podstawowych czynności, do których programiści mogliby go używać.

Suiche zachowuje jednak pewien spokój. Przyznaje, że na etapie pierwszego dużego publicznego wypuszczenia lepiej łapać za dużo niż za mało, a guardrails będą ewoluować w miarę jak Anthropic będzie współpracować z nowymi firmami z branży bezpieczeństwa. Anthropic nie odpowiedziało na pytania TechCruncha przed publikacją artykułu.

Program weryfikacji jako obejście

Anthropic ma gotową odpowiedź dla profesjonalistów: Cyber Verification Program. Po złożeniu wniosku i zatwierdzeniu kandydaci otrzymują mniej ograniczeń przy używaniu Claude do pracy z cyberbezpieczeństwem. OpenAI prowadzi analogiczny program o nazwie Trusted Access for Cyber.

Tyle że samo istnienie takiego programu potwierdza, że domyślne ustawienia Fable są zbyt restrykcyjne dla osób, które najbardziej potrzebują tego modelu - i które miały być jego główną grupą docelową. Fable został zablokowany na tyle agresywnie, że badacz proszący o przeczytanie bloga dostaje odmowę z powodów bezpieczeństwa.

[AI] Artykuł powstał z pomocą AI na podstawie weryfikowanych źródeł i zredagowany przez redakcję Odkrywaj.AI.