Fable od Anthropic blokuje nawet prośby o code review
- Anthropic opublikowało model Fable 10 czerwca 2026 jako publiczną wersję modelu Mythos dedykowanego cyberbezpieczeństwu.
- Guardrails blokują zapytania luźno związane z cyberbezpieczeństwem, w tym prośby o code review i pisanie bezpiecznego kodu.
- Gdy model trafi na guardrail, automatycznie spada do Claude Opus 4.8 zamiast kontynuować rozmowę.
Anthropic wypuściło Fable 10 czerwca 2026 r. jako okrojoną, publiczną wersję Mythosa - swojego mocno reklamowanego modelu do pracy z cyberbezpieczeństwem. Problem: badacze natychmiast zaczęli narzekać, że model blokuje nawet najbardziej niewinne zapytania.
Guardrails, które widzą zagrożenie wszędzie
Valentina “Chompie” Palmiotti z IBM X-Force napisała wprost, że Fable odrzuca każde zapytanie, które choćby zahacza o tematykę cyber - łącznie z prośbą o przeczytanie wpisu na blogu. Kiedy model trafia na swój trigger, wyświetla komunikat, że “środki bezpieczeństwa oznaczyły tę wiadomość jako dotyczącą cyberbezpieczeństwa lub biologii” i zatrzymuje czat.
Matt Suiche, weteran branży security i członek zespołu technicznego w startupie Tolmo, zgłosił TechCrunchowi konkretny przypadek: prośba o napisanie bezpiecznego kodu sprawia, że Fable traktuje zadanie jako pracę z zakresu cyberbezpieczeństwa, zamiast zwykłych praktyk inżynierskich. Efekt? Model schodzi o poziom niżej do Claude Opus 4.8.
“Wygląda na to, że działa na zasadzie słów kluczowych - cokolwiek z pola leksykalnego ‘cybersecurity’ odpala guardrail” - powiedział Suiche.
Skąd te ograniczenia?
Anthropic tłumaczy restrykcje obawą przed użyciem modelu do tworzenia malware’u lub kompromitowania oprogramowania. Blokady dotyczące biologii wynikają z podobnych obaw wokół broni biologicznej.
Historia Mythosa zaczęła się w kwietniu 2026 r., kiedy Anthropic udostępniło go wąskiej grupie firm w ramach Project Glasswing - inicjatywy mającej zabezpieczać krytyczną infrastrukturę i oprogramowanie. W zeszłym tygodniu Anthropic rozszerzyło dostęp do Mythosa na setki organizacji w 15 krajach. Fable to próba dotarcia do szerszej publiczności, ale z mocno przyciętymi możliwościami.
Czy keyword-based filtering w 2026 r. to żart?
Krytyka sprowadza się do jednego: filtrowanie oparte na słowach kluczowych to rozwiązanie z epoki poprzedzającej LLM-y. Inny badacz poskarżył się na X, że nawet prośba o code review odpala guardrail - czyli model blokuje jedną z najbardziej podstawowych czynności, do których programiści mogliby go używać.
Suiche zachowuje jednak pewien spokój. Przyznaje, że na etapie pierwszego dużego publicznego wypuszczenia lepiej łapać za dużo niż za mało, a guardrails będą ewoluować w miarę jak Anthropic będzie współpracować z nowymi firmami z branży bezpieczeństwa. Anthropic nie odpowiedziało na pytania TechCruncha przed publikacją artykułu.
Program weryfikacji jako obejście
Anthropic ma gotową odpowiedź dla profesjonalistów: Cyber Verification Program. Po złożeniu wniosku i zatwierdzeniu kandydaci otrzymują mniej ograniczeń przy używaniu Claude do pracy z cyberbezpieczeństwem. OpenAI prowadzi analogiczny program o nazwie Trusted Access for Cyber.
Tyle że samo istnienie takiego programu potwierdza, że domyślne ustawienia Fable są zbyt restrykcyjne dla osób, które najbardziej potrzebują tego modelu - i które miały być jego główną grupą docelową. Fable został zablokowany na tyle agresywnie, że badacz proszący o przeczytanie bloga dostaje odmowę z powodów bezpieczeństwa.