LLM-y nie rozumieją świata — firmy AI szukają wyjścia

MIT Technology Review pyta wprost: czy AI jest w stanie zrozumieć świat zewnętrzny? World models wróciły do centrum debaty.
LLM-y nie rozumieją świata — firmy AI szukają wyjścia
TL;DR
  • Firmy AI coraz głośniej przyznają, że obecne LLM-y mają fundamentalne ograniczenia w rozumieniu świata zewnętrznego.
  • Koncepcja world models — systemów modelujących rzeczywistość, nie tylko tekst — wraca jako możliwa odpowiedź na te braki.
  • MIT Technology Review poświęciło temu tematowi osobną sesję dyskusyjną z redaktorem naczelnym Matem Honanem i starszym redaktorem ds.

LLM-y nie rozumieją świata — i wszyscy to już wiedzą

MIT Technology Review zwołało roundtable z jednym pytaniem na stole: czy AI jest w stanie nauczyć się rozumieć świat? Brzmi filozoficznie, ale chodzi o coś bardzo konkretnego — obecne duże modele językowe przetwarzają tekst, ale nie mają wewnętrznej reprezentacji rzeczywistości. Nie wiedzą, że szklanka może spaść ze stołu. Nie rozumieją, że jeśli coś jest za drzwiami, to wciąż istnieje.

To nie jest nowa obserwacja. Yann LeCun z Meta od lat twierdzi, że LLM-y to ślepa uliczka jeśli chodzi o AGI, właśnie z tego powodu. Ale dopiero teraz temat world models — czyli modeli, które budują wewnętrzną symulację świata fizycznego i społecznego — trafił do mainstreamu branżowej dyskusji.

Czym właściwie jest world model i dlaczego teraz?

World model to system, który nie tylko przewiduje następny token, ale modeluje relacje przyczynowo-skutkowe, fizykę i kontekst czasowy. Wyobraź sobie różnicę między modelem, który wie jak opisać toczącą się piłkę, a takim, który rozumie, że piłka się stoczy, zanim to opisze.

Do tej pory concept żył głównie w robotyce i reinforcement learning. OpenAI, Google DeepMind i Meta zaczęły jednak wrzucać go do szerszych rozmów o architekturze przyszłych systemów. DeepMind wprost wskazuje world models jako jeden z kierunków prac nad Gemini w kolejnych iteracjach.

Dlaczego teraz? Bo skalowanie przestało wystarczać. GPT-4 do GPT-4o nie był takim skokiem jak GPT-3 do GPT-4. Kolejne 10x parametrów nie rozwiązuje problemu rozumowania przestrzennego ani planowania długoterminowego. Firmy szukają nowej osi poprawy.

Trzy rzeczy, których LLM-y nie potrafią

Sesja MIT Technology Review dotknęła kilku konkretnych słabości:

  • Rozumowanie przestrzenne — modele językowe mają poważne problemy z zadaniami wymagającymi wyobrażenia sobie obiektu w 3D lub jego rotacji.
  • Planowanie z ograniczeniami fizycznymi — agent AI nie „wie
[AI] Artykuł powstał z pomocą AI na podstawie weryfikowanych źródeł i zredagowany przez redakcję Odkrywaj.AI.