Gemma 4 od Google DeepMind dostępna na Amazon Bedrock
- Amazon Bedrock udostępnił trzy warianty Gemma 4 od Google DeepMind na licencji Apache 2.0.
- Modele oferują okno kontekstu do 256K tokenów, wbudowany reasoning i natywne function calling.
- Gemma 4 31B uzyskuje Intelligence Index 39 według Artificial Analysis, przy medianie 15 dla modeli 4B-40B.
Amazon Bedrock udostępnił rodzinę Gemma 4 od Google DeepMind - trzy modele open-weight już dostępne w produkcji: Gemma 4 31B, Gemma 4 26B-A4B i Gemma 4 E2B.
Trzy modele, dwie architektury
Gemma 4 31B to gęsty model z 30,7 miliarda parametrów i oknem kontekstu 256K tokenów. Gemma 4 26B-A4B działa na architekturze Mixture-of-Experts - aktywuje tylko 3,8B z 25,2B parametrów na jedno zapytanie, co obniża koszty inferencji bez proporcjonalnego spadku jakości. Gemma 4 E2B to kompaktowy wariant: 5,1B parametrów łącznie, 2,3B efektywnych, okno 128K tokenów.
Wszystkie trzy obsługują tekst i obrazy, mają wbudowany tryb reasoning, natywne function calling oraz wsparcie dla ponad 35 języków z pretreningiem na ponad 140.
Czy MoE faktycznie oszczędza pieniądze?
Na papierze Mixture-of-Experts brzmi świetnie - płacisz za aktywne parametry, nie za całość modelu. Gemma 4 26B-A4B aktywuje 3,8B parametrów per request przy modelu ważącym 25,2B. To oznacza, że latencja i koszt obliczeniowy zbliżają się do małego modelu, a jakość - przynajmniej teoretycznie - do dużego.
Artificial Analysis podaje Intelligence Index 39 dla Gemma 4 31B, przy medianie 15 dla klasy 4B-40B open-weights. 26B-A4B nie ma jeszcze osobnego benchmarku w tym rankingu, więc trzeba zaufać danym producenta.
Bedrock usuwa operacyjny ból głowy
Modele open-weight mają jeden powtarzający się problem: żeby je odpalić na własnej infrastrukturze, trzeba zorganizować hosting wag, zadbać o skalowanie i pilnować bezpieczeństwa danych. AWS rozwiązuje to przez w pełni zarządzaną usługę - inferencja działa na infrastrukturze AWS, prompty i odpowiedzi nie trafiają do treningu modeli, a dane nie są współdzielone z podmiotami trzecimi.
Dostępne są trzy tiery: Standard, Priority i Flex - dla każdego z trzech wariantów. On-demand inference skaluje się automatycznie bez rezerwowania pojemności z góry.
Który wariant wybrać?
AWS w dokumentacji daje konkretne wskazówki:
- Gemma 4 31B - zadania wymagające głębokiego rozumowania i kodowania, gdy zależy ci na jednym gęstym modelu
- Gemma 4 26B-A4B - workloady wymagające balansu między jakością a kosztem, szczególnie przy dużej liczbie requestów
- Gemma 4 E2B - lekkie aplikacje, edge deployment, scenariusze gdzie latencja bije jakość
Czy open-weight na Bedrocku ma sens finansowy?
To pytanie, które zadaje sobie każdy team wybierający między API proprietary a hostem open-weight. Gemma 4 na Bedrocku to hybryda: masz dostęp do wag (możesz je zbenchmarkować i fine-tunować na własnych danych), ale uruchamiasz je przez AWS bez własnego stosu inferencyjnego.
Licencja Apache 2.0 pozwala na użycie komercyjne bez opłat licencyjnych. Koszty to wyłącznie inferencja przez Bedrock - AWS nie podał jeszcze publicznie cennika per token dla Gemma 4, więc przed migracją warto sprawdzić aktualny katalog modeli.
Fine-tuning na własnych danych jest możliwy, ale wymaga osobnego pipeline’u poza Bedrockiem - same wagi można pobrać z Hugging Face i dostosować do specyficznych danych.
Gemma 4 E2B z 2,3B efektywnymi parametrami i oknem 128K tokenów to jeden z bardziej kompaktowych modeli multimodalnych dostępnych przez zarządzane API - dla teamów budujących lekkie agenty dokumentowe to może być ciekawsza opcja niż sięganie po drogie modele frontierowe.