RCCLX od Meta przyspiesza AMD o 50% - open source już dostępny

Meta open-sourcuje RCCLX - bibliotekę komunikacji GPU dla AMD, która skraca czas generowania tokenów o 10%.
Schemat komunikacji między kartami GPU AMD MI300X w klastrze serwerowym
TL;DR
  • Meta opublikowała RCCLX, rozszerzoną wersję biblioteki RCCL zoptymalizowaną pod karty AMD Instinct MI300X, z dwoma nowymi mechanizmami przyspieszającymi komunikację między GPU.
  • Algorytm DDA redukuje latencję operacji AllReduce o 10-50% dla małych wiadomości, co przekłada się na 10% skrócenie czasu generowania kolejnych tokenów.
  • Biblioteka obsługuje też niskoprецyzyjne kolektywy z kompresją FP8 w stosunku 4:1, zmniejszając narzut komunikacyjny przy trenowaniu i inferencji.

Meta open-sourcuje RCCLX - bibliotekę komunikacji GPU dla AMD MI300X - i przy okazji wykręca 10-50% poprawy latencji względem bazowego RCCL. Projekt jest już zintegrowany z Torchcomms i dostępny publicznie od 24 lutego 2026.

DDA robi z O(N) stałą latencję

AllReduce to jedno z najdroższych operacji w trenowaniu modeli z tensor parallelism - potrafi zjadać do 30% całkowitego czasu wykonania. Meta rozwiązuje to przez Direct Data Access (DDA), czyli mechanizm, w którym każdy rank bezpośrednio czyta pamięć sąsiednich GPU zamiast przepychać dane przez kolejne węzły.

Są dwa warianty. Algorytm flat dla małych wiadomości zamienia złożoność O(N) na O(1) - każdy rank ładuje dane od razu od wszystkich pozostałych i redukuje lokalnie. Algorytm tree działa na nieco większych wiadomościach i rozbija AllReduce na reduce-scatter plus all-gather, zachowując tę samą ilość przesyłanych danych co ring, ale redukując latencję do stałego współczynnika.

Na AMD MI300X efekt jest konkretny: 10-50% szybciej dla decode (małe wiadomości), 10-30% dla prefill, a łącznie TTIT - czas do wygenerowania kolejnego tokenu - spada o około 10%.

Czy LLM jest compute-bound czy memory-bound - to nie jest obojętne

Prefill i decode to dwie różne bestie. Prefill przetwarza cały prompt naraz i jest compute-bound, bo attention skaluje się kwadratowo z długością sekwencji. Decode generuje tokeny jeden po jednym i jest memory-bound - GPU spędza większość czasu na czytaniu wag i KV cache z pamięci, a nie na liczeniu.

DDA flat celuje właśnie w decode, gdzie małe wiadomości i niska latencja mają największe przełożenie na UX. Użytkownik czekający na kolejny token odczuje 10% poprawę TTIT bezpośrednio.

Niskoprецyzyjne kolektywy i kompresja 4:1

Druga nowa funkcja to Low Precision Collectives - zestaw algorytmów AllReduce, AllGather, AlltoAll i ReduceScatter zoptymalizowanych pod MI300 i nadchodzące MI350. Obsługują FP32 i BF16 jako typy wejściowe, ale komunikację realizują przez FP8, co daje kompresję 4:1.

Mniej bajtów w locie to mniejszy narzut komunikacyjny i lepsza skalowalność przy większych klastrach. Meta testowała to na własnych workloadach produkcyjnych, więc nie są to liczby z syntetycznych benchmarków.

Skąd się wziął RCCLX i co ma wspólnego z CTran

Meta wcześniej odpalił CTran - własny transport dla NVIDII. RCCLX to przeniesienie tej pracy na AMD, z integracją CTran i nowym kolektywem AllToAllvDynamic, który działa bezpośrednio na GPU (GPU-resident collective).

Nie wszystkie funkcje CTran trafiły jeszcze do open-source’owej wersji RCCLX. Meta zapowiada dalsze aktualizacje w ciągu najbliższych miesięcy, bez podawania konkretnych dat.

Czy AMD dogania NVIDIĘ w infrastrukturze ML?

To pytanie, które środowisko MLOps zadaje sobie od dwóch lat. Ekosystem softwarowy AMD - ROCm, RCCL - historycznie odstawał od CUDA. Meta inwestuje własne zasoby inżynierskie w łatanie tych dziur, co jest sygnałem, że MI300X jest u nich realnie używany produkcyjnie, a nie tylko w testach.

RCCLX nie rozwiązuje wszystkich problemów z komunikacją na AMD, ale DDA i LP Collectives to konkretne, zmierzone ulepszenia. Biblioteka jest dostępna na GitHubie - można ją odpalić na własnym klastrze MI300X i sprawdzić, czy 10% TTIT to liczba, która pojawi się też poza Menlo Park.

[AI] Artykuł powstał z pomocą AI na podstawie weryfikowanych źródeł i zredagowany przez redakcję Odkrywaj.AI.