LLM zapomina co robił 1000 kroków temu - Berkeley ma fix
- Badacze z Berkeley AI Research Lab zaprezentowali 26 lipca 2026 framework ABBEL, który zastępuje klasyczne podsumowania kontekstu tzw.
- stanami przekonań w języku naturalnym.
- Metoda izoluje i nadzoruje zawartość informacyjną skrótów, co poprawia uczenie modeli przy długich zadaniach wieloetapowych.
Badacze z Berkeley AI Research Lab (BAIR) opublikowali 26 lipca 2026 framework ABBEL, który ma rozwiązać jeden z bardziej bolesnych problemów przy długich zadaniach: modele językowe po prostu tracą wątek po kilkuset krokach.
Summarization to plaster, nie rozwiązanie
Klasyczne podejście - generowanie skrótów historii konwersacji, zwane też context compaction - wygląda sensownie na papierze, ale w praktyce się sypie. Cursor oficjalnie odradza użytkownikom włączanie compaction w trakcie sesji kodowania. Composer 2.5 od Cursor używa kompresji podczas treningu, ale to nie eliminuje problemu na poziomie inferencji. Grandcode, pierwszy system, który regularnie pokonuje wszystkich ludzkich uczestników zawodów programistycznych - oparty na Qwen 3.5-397B - też musiał wdrożyć summarization, bo bez tego nie dało się obsłużyć długich sesji.
Problemu nie rozwiązuje więcej danych. Degradacja wydajności wynika z trudności z budową dobrych symulatorów ludzkich zachowań, które generowałyby wysokiej jakości trajektorie treningowe.
Czy modele uczą się podsumowywać skutecznie?
Krótka odpowiedź: nie w takim stopniu, w jakim byśmy chcieli. Autorzy odpalili test na Combination Lock - grze w stylu Wordle, gdzie model ma do 16 prób odgadnięcia słowa. Porównali model operujący na pełnym kontekście z modelem używającym context summary podczas fine-tuningu przez RL.
Oba typy poprawiają wyniki w trakcie treningu. Model z podsumowaniami nigdy nie dogania modelu z pełnym kontekstem. Luka zostaje.
To dlatego, że jednoczesne uczenie się zadania i generowania dobrego skrótu to podwójna komplikacja dla modelu - i gdy danych jest mało (a w domenach jak collaborative code generation zwykle jest), coś musi się posypać.
ABBEL: bottleneck z nadzorem
ABBEL (Autoencoder-Based Belief for Efficient Long-horizon interaction) rozkłada problem. Zamiast kazać modelowi jednocześnie działać i kompresować historię, framework:
- Formułuje skróty jako stany przekonań (belief states) w języku naturalnym, wzorując się na rekurencyjnej estymacji bayesowskiej
- Periodycznie aktualizuje te stany na podstawie nowych obserwacji
- Stosuje belief grading - mechanizm oceniający, czy z danego stanu przekonań da się zrekonstruować konkretne informacje z historii
Belief grading działa jak autoenkoder: model koduje poprzedni stan przekonań, akcję i obserwację w nowy stan posteriorowy, a następnie jest nagradzany za to, jak dobrze wybrane fragmenty historii można z tego stanu odtworzyć. To bezpośredni nadzór nad zawartością informacyjną skrótu - nie tylko nad efektem końcowym zadania.
Rollout wygląda tak: aktualizacje stanu przekonań z najnowszej obserwacji naprzemiennie z selekcją akcji warunkowaną wyłącznie bieżącym stanem posteriorowym. Model nigdy nie widzi surowej historii - tylko belief state.
Dlaczego to działa tam, gdzie compaction zawodzi?
Izolacja zadania to klucz. Klasyczne podejście uczy modelu wszystkiego naraz - działania, kompresji, rozumowania. ABBEL rozdziela te odpowiedzialności i nadzoruje każdą osobno.
Dodatkowo belief states są interpretowalnym formatem - to naturalny język, nie ukryty wektor. Można je czytać, debugować, weryfikować. W kontekście narzędzi dla programistów (główna motywacja badaczy) to istotna zaleta: użytkownik może sprawdzić, co agent “pamięta” o bieżącym projekcie.
Co z tym dalej?
Badanie pochodzi z laboratorium akademickiego, więc naturalnym pytaniem jest skalowalność poza środowisko testowe. Combination Lock to kontrolowane środowisko z jasno zdefiniowanymi obserwacjami - collaborative code generation to kilka rzędów wielkości więcej szumu.
Autorzy wskazują wprost, że problem z danymi treningowymi pozostaje: ludzkie symulatory do generowania wieloturowych trajektorii w kodowaniu są trudne do zbudowania i użycia. ABBEL nie tworzy tych danych - poprawia efektywność uczenia na tych, które już masz.
Grandcode pokonuje wszystkich ludzkich programistów online, a mimo to musi kompresować kontekst. To niezłe przypomnienie, jak daleko jeszcze do modeli, które naprawdę pamiętają całą sesję.