Nowy Claude odmawia mówić o katarze - celowo
- Claude Fable 5, najnowszy model Anthropic z rodziny Mythos, odmawia odpowiedzi na podstawowe pytania biologiczne, przekazując rozmowę do starszego modelu Opus 4.8.
- Anthropic przyznaje, że zastosował celowo nadmiernie konserwatywne filtry, obawiając się wykorzystania modelu do badań nad bronią biologiczną.
- Firma zapowiada pracę nad ograniczeniem liczby błędnych blokad, które dotykają również nieszkodliwe pytania edukacyjne.
Claude Fable 5 odmówi ci wyjaśnienia, czym są priony, skąd bierze się katar sienny i jak działają szczepionki mRNA - a Anthropic twierdzi, że tak ma być.
Najnowszy model firmy, pierwszy z rodziny Mythos, trafił do szerszego grona użytkowników z wyjątkowo restrykcyjnymi filtrami biologicznymi. Kiedy pytanie zahacza o biologię, model nie próbuje odpowiedzieć - po prostu przekazuje rozmowę do starszego Claude Opus 4.8, który takich oporów nie ma.
Mitochondrium to zagrożenie dla bezpieczeństwa?
The Verge przetestował granice modelu i lista zablokowanych tematów jest zaskakująco szeroka. Claude Fable 5 odmawiał rozmów o błonach komórkowych, prionach wywołujących chorobę szalonych krów, mechanizmie działania szczepionek mRNA, przyczynach kataru siennego, lekach na astmę, antybiotykooporności i sposobie rozprzestrzeniania się Eboli.
Niektóre pytania przechodziły bez problemu - model rozmawiał o DNA i nowotworach. Logika tej granicy pozostaje niejasna dla użytkowników.
Rzeczniczka Anthropic Paruul Maheshwary potwierdziła w rozmowie z The Verge, że przy wdrożeniu Fable 5 firma świadomie zdecydowała się na “nadmiernie konserwatywne” filtry blokujące większość zapytań związanych z pracą biologiczną. Według niej to kompromis: lepiej wypuścić model teraz z przesadnymi ograniczeniami niż dalej opóźniać premierę.
Czy bezpieczniejszy znaczy mniej użyteczny?
Anthropic od miesięcy pozycjonuje Fable 5 jako model o wyjątkowych możliwościach - szczególnie w programowaniu, analizie danych i długim rozumowaniu. Na blogu firmowym chwalił się między innymi wiedzą z zakresu biologii. Użytkownicy szybko zweryfikowali tę deklarację w praktyce.
Mechanizm przekazywania rozmów do Opus 4.8 działa technicznie sprawnie, ale rodzi pytanie o sens korzystania z droższego, bardziej zaawansowanego modelu, skoro w połowie zapytań naukowych i tak odpowiada starszy system.
Firma tłumaczy ostrożność obawą, że model klasy Mythos mógłby zostać wykorzystany do badań wspierających rozwój broni biologicznej. To nie jest abstrakcyjny scenariusz - rządy i badacze bezpieczeństwa regularnie testują, czy zaawansowane modele językowe obniżają barierę dostępu do wiedzy o patogenach bojowych.
Dwa standardy w jednym modelu
Zaskakujące jest zestawienie tego, czego Fable 5 odmawia, z tym, na co chętnie odpowiada. Model bez problemu wyjaśniał, czym jest trotyl, opisywał użycie chloru jako broni chemicznej, omawiał podatności haseł i wykładał podstawy fuzji jądrowej. Odmawiał za to rozmów o sarinie - i, co ciekawe, blokował pytania o wąglika zarówno w wersji Fable 5, jak i Opus 4.8.
Ta niekonsekwencja pokazuje, że filtry biologiczne działają inaczej niż reszta zabezpieczeń. Nie ma tu jednej spójnej logiki - wygląda to bardziej jak szeroka, nieskalibrowna siatka rzucona na całą biologię, zamiast precyzyjnego celowania w faktycznie niebezpieczne informacje.
Anthropic obiecuje poprawki
Firma zapewnia, że aktywnie pracuje nad zmniejszeniem liczby fałszywych blokad. Nie podała jednak konkretnych dat ani zakresu planowanych zmian.
Tymczasem użytkownicy, którzy zapłacili za dostęp do najnowszego modelu, dostają odpowiedzi od starszego - ilekroć temat dotyczy elementarnej edukacji przyrodniczej. Pytanie, ile z nich w ogóle wie, kiedy Fable 5 cichcem odpuszcza i podstawia Opus 4.8.