Gemma 4 od Google DeepMind dostępna na Amazon Bedrock

Amazon Bedrock dodaje trzy modele Gemma 4: 31B, 26B-A4B i E2B. Wszystkie mają reasoning, function calling i obsługę obrazów.
Ilustracja modeli AI Gemma 4 dostępnych w chmurze Amazon Bedrock
TL;DR
  • Amazon Bedrock udostępnił trzy warianty Gemma 4 od Google DeepMind na licencji Apache 2.0.
  • Modele oferują okno kontekstu do 256K tokenów, wbudowany reasoning i natywne function calling.
  • Gemma 4 31B uzyskuje Intelligence Index 39 według Artificial Analysis, przy medianie 15 dla modeli 4B-40B.

Amazon Bedrock udostępnił rodzinę Gemma 4 od Google DeepMind - trzy modele open-weight już dostępne w produkcji: Gemma 4 31B, Gemma 4 26B-A4B i Gemma 4 E2B.

Trzy modele, dwie architektury

Gemma 4 31B to gęsty model z 30,7 miliarda parametrów i oknem kontekstu 256K tokenów. Gemma 4 26B-A4B działa na architekturze Mixture-of-Experts - aktywuje tylko 3,8B z 25,2B parametrów na jedno zapytanie, co obniża koszty inferencji bez proporcjonalnego spadku jakości. Gemma 4 E2B to kompaktowy wariant: 5,1B parametrów łącznie, 2,3B efektywnych, okno 128K tokenów.

Wszystkie trzy obsługują tekst i obrazy, mają wbudowany tryb reasoning, natywne function calling oraz wsparcie dla ponad 35 języków z pretreningiem na ponad 140.

Czy MoE faktycznie oszczędza pieniądze?

Na papierze Mixture-of-Experts brzmi świetnie - płacisz za aktywne parametry, nie za całość modelu. Gemma 4 26B-A4B aktywuje 3,8B parametrów per request przy modelu ważącym 25,2B. To oznacza, że latencja i koszt obliczeniowy zbliżają się do małego modelu, a jakość - przynajmniej teoretycznie - do dużego.

Artificial Analysis podaje Intelligence Index 39 dla Gemma 4 31B, przy medianie 15 dla klasy 4B-40B open-weights. 26B-A4B nie ma jeszcze osobnego benchmarku w tym rankingu, więc trzeba zaufać danym producenta.

Bedrock usuwa operacyjny ból głowy

Modele open-weight mają jeden powtarzający się problem: żeby je odpalić na własnej infrastrukturze, trzeba zorganizować hosting wag, zadbać o skalowanie i pilnować bezpieczeństwa danych. AWS rozwiązuje to przez w pełni zarządzaną usługę - inferencja działa na infrastrukturze AWS, prompty i odpowiedzi nie trafiają do treningu modeli, a dane nie są współdzielone z podmiotami trzecimi.

Dostępne są trzy tiery: Standard, Priority i Flex - dla każdego z trzech wariantów. On-demand inference skaluje się automatycznie bez rezerwowania pojemności z góry.

Który wariant wybrać?

AWS w dokumentacji daje konkretne wskazówki:

  • Gemma 4 31B - zadania wymagające głębokiego rozumowania i kodowania, gdy zależy ci na jednym gęstym modelu
  • Gemma 4 26B-A4B - workloady wymagające balansu między jakością a kosztem, szczególnie przy dużej liczbie requestów
  • Gemma 4 E2B - lekkie aplikacje, edge deployment, scenariusze gdzie latencja bije jakość

Czy open-weight na Bedrocku ma sens finansowy?

To pytanie, które zadaje sobie każdy team wybierający między API proprietary a hostem open-weight. Gemma 4 na Bedrocku to hybryda: masz dostęp do wag (możesz je zbenchmarkować i fine-tunować na własnych danych), ale uruchamiasz je przez AWS bez własnego stosu inferencyjnego.

Licencja Apache 2.0 pozwala na użycie komercyjne bez opłat licencyjnych. Koszty to wyłącznie inferencja przez Bedrock - AWS nie podał jeszcze publicznie cennika per token dla Gemma 4, więc przed migracją warto sprawdzić aktualny katalog modeli.

Fine-tuning na własnych danych jest możliwy, ale wymaga osobnego pipeline’u poza Bedrockiem - same wagi można pobrać z Hugging Face i dostosować do specyficznych danych.

Gemma 4 E2B z 2,3B efektywnymi parametrami i oknem 128K tokenów to jeden z bardziej kompaktowych modeli multimodalnych dostępnych przez zarządzane API - dla teamów budujących lekkie agenty dokumentowe to może być ciekawsza opcja niż sięganie po drogie modele frontierowe.

[AI] Artykuł powstał z pomocą AI na podstawie weryfikowanych źródeł i zredagowany przez redakcję Odkrywaj.AI.