LLM zapomina co robił 1000 kroków temu - Berkeley ma fix

Badacze z Berkeley opublikowali ABBEL - framework zastępujący historię konwersacji stanami przekonań, który poprawia efektywność długich zadań AI.
Schemat systemu ABBEL z diagramem stanów przekonań zastępujących historię interakcji
TL;DR
  • Badacze z Berkeley AI Research Lab zaprezentowali 26 lipca 2026 framework ABBEL, który zastępuje klasyczne podsumowania kontekstu tzw.
  • stanami przekonań w języku naturalnym.
  • Metoda izoluje i nadzoruje zawartość informacyjną skrótów, co poprawia uczenie modeli przy długich zadaniach wieloetapowych.

Badacze z Berkeley AI Research Lab (BAIR) opublikowali 26 lipca 2026 framework ABBEL, który ma rozwiązać jeden z bardziej bolesnych problemów przy długich zadaniach: modele językowe po prostu tracą wątek po kilkuset krokach.

Summarization to plaster, nie rozwiązanie

Klasyczne podejście - generowanie skrótów historii konwersacji, zwane też context compaction - wygląda sensownie na papierze, ale w praktyce się sypie. Cursor oficjalnie odradza użytkownikom włączanie compaction w trakcie sesji kodowania. Composer 2.5 od Cursor używa kompresji podczas treningu, ale to nie eliminuje problemu na poziomie inferencji. Grandcode, pierwszy system, który regularnie pokonuje wszystkich ludzkich uczestników zawodów programistycznych - oparty na Qwen 3.5-397B - też musiał wdrożyć summarization, bo bez tego nie dało się obsłużyć długich sesji.

Problemu nie rozwiązuje więcej danych. Degradacja wydajności wynika z trudności z budową dobrych symulatorów ludzkich zachowań, które generowałyby wysokiej jakości trajektorie treningowe.

Czy modele uczą się podsumowywać skutecznie?

Krótka odpowiedź: nie w takim stopniu, w jakim byśmy chcieli. Autorzy odpalili test na Combination Lock - grze w stylu Wordle, gdzie model ma do 16 prób odgadnięcia słowa. Porównali model operujący na pełnym kontekście z modelem używającym context summary podczas fine-tuningu przez RL.

Oba typy poprawiają wyniki w trakcie treningu. Model z podsumowaniami nigdy nie dogania modelu z pełnym kontekstem. Luka zostaje.

To dlatego, że jednoczesne uczenie się zadania i generowania dobrego skrótu to podwójna komplikacja dla modelu - i gdy danych jest mało (a w domenach jak collaborative code generation zwykle jest), coś musi się posypać.

ABBEL: bottleneck z nadzorem

ABBEL (Autoencoder-Based Belief for Efficient Long-horizon interaction) rozkłada problem. Zamiast kazać modelowi jednocześnie działać i kompresować historię, framework:

  • Formułuje skróty jako stany przekonań (belief states) w języku naturalnym, wzorując się na rekurencyjnej estymacji bayesowskiej
  • Periodycznie aktualizuje te stany na podstawie nowych obserwacji
  • Stosuje belief grading - mechanizm oceniający, czy z danego stanu przekonań da się zrekonstruować konkretne informacje z historii

Belief grading działa jak autoenkoder: model koduje poprzedni stan przekonań, akcję i obserwację w nowy stan posteriorowy, a następnie jest nagradzany za to, jak dobrze wybrane fragmenty historii można z tego stanu odtworzyć. To bezpośredni nadzór nad zawartością informacyjną skrótu - nie tylko nad efektem końcowym zadania.

Rollout wygląda tak: aktualizacje stanu przekonań z najnowszej obserwacji naprzemiennie z selekcją akcji warunkowaną wyłącznie bieżącym stanem posteriorowym. Model nigdy nie widzi surowej historii - tylko belief state.

Dlaczego to działa tam, gdzie compaction zawodzi?

Izolacja zadania to klucz. Klasyczne podejście uczy modelu wszystkiego naraz - działania, kompresji, rozumowania. ABBEL rozdziela te odpowiedzialności i nadzoruje każdą osobno.

Dodatkowo belief states są interpretowalnym formatem - to naturalny język, nie ukryty wektor. Można je czytać, debugować, weryfikować. W kontekście narzędzi dla programistów (główna motywacja badaczy) to istotna zaleta: użytkownik może sprawdzić, co agent “pamięta” o bieżącym projekcie.

Co z tym dalej?

Badanie pochodzi z laboratorium akademickiego, więc naturalnym pytaniem jest skalowalność poza środowisko testowe. Combination Lock to kontrolowane środowisko z jasno zdefiniowanymi obserwacjami - collaborative code generation to kilka rzędów wielkości więcej szumu.

Autorzy wskazują wprost, że problem z danymi treningowymi pozostaje: ludzkie symulatory do generowania wieloturowych trajektorii w kodowaniu są trudne do zbudowania i użycia. ABBEL nie tworzy tych danych - poprawia efektywność uczenia na tych, które już masz.

Grandcode pokonuje wszystkich ludzkich programistów online, a mimo to musi kompresować kontekst. To niezłe przypomnienie, jak daleko jeszcze do modeli, które naprawdę pamiętają całą sesję.

[AI] Artykuł powstał z pomocą AI na podstawie weryfikowanych źródeł i zredagowany przez redakcję Odkrywaj.AI.