Które GPT są open source?

0 wyświetleń
Obecnie które gpt są open source ogranicza się do projektów społecznościowych. Gpt-oss 120b oferuje najwyższą precyzję obliczeniową. Gpt-oss 20b stanowi lżejszą alternatywę dla słabszych jednostek. Te modele gpt open source są dostępne w publicznych repozytoriach od 2024 roku. Wybór zależy od dostępnej pamięci VRAM oraz wymaganej szybkości generowania tekstu.
Komentarz 0 polubień

Które gpt są open source? Gpt-oss 120b vs 20b

Pytanie o które gpt są open source nabiera znaczenia w kontekście prywatności danych i kontroli nad technologią. Samodzielne hostowanie modeli pozwala uniknąć opłat subskrypcyjnych oraz chroni wrażliwe informacje. Zrozumienie dostępnych licencji chroni przed naruszeniami prawnymi. Warto poznać szczegóły techniczne, aby zoptymalizować pracę własnej infrastruktury AI.

Najczęściej zadawane pytania o open source GPT

Porównanie gpt-oss-120B i gpt-oss-20B

Oba modele opublikowano na Hugging Face, ale ich przeznaczenie i wymagania są zupełnie inne.

gpt-oss-120B (Mixture of Experts)

  1. Do uruchomienia w pełnej precyzji FP16 potrzeba ok. 240 GB VRAM. Po kwantyzacji do 4-bit (np. za pomocą AutoGPTQ) można zmieścić się na 60–80 GB VRAM – [4] to wymaga co najmniej dwóch kart H100 lub jednej A100 80GB.
  2. Idealny do zadań wymagających głębokiej wiedzy, generowania długich dokumentów, analizy dużych zbiorów danych oraz zastosowań badawczych, gdzie precyzja i bogactwo odpowiedzi są kluczowe.
  3. Dzięki architekturze MoE generuje tokeny szybciej niż model gęsty o tej samej liczbie parametrów – typowo 1,5–2 razy szybciej w porównaniu z hipotetycznym gęstym modelem 120B.
  4. 120 miliardów – w trybie Mixture of Experts (MoE) aktywowanych jest tylko około 5 miliardów na każde zapytanie [2], co pozwala zachować wydajność przy ogromnej pojemności wiedzy.

gpt-oss-20B (Dense)

  1. W FP16 potrzeba ok. 40 GB VRAM. Po kwantyzacji do 4-bit wystarczy 10–12 GB VRAM – [7] można uruchomić nawet na jednej karcie RTX 4090 (24 GB) lub dwóch RTX 3090.
  2. Sprawdzi się w zastosowaniach produkcyjnych z ograniczonym budżetem sprzętowym: chatboty, asystenci programistów, systemy RAG na średniej wielkości danych.
  3. Działa szybko na sprzęcie konsumenckim – z 4-bitową kwantyzacją osiąga 30–50 tokenów/s na RTX 4090, co wystarcza do interakcji w czasie rzeczywistym.
  4. 20 miliardów – klasyczna gęsta architektura, wszystkie parametry aktywowane przy każdym zapytaniu [5].
Wybór między modelami sprowadza się do kompromisu: gpt-oss-120B oferuje większą inteligencję i wydajność kosztem wysokich wymagań sprzętowych, podczas gdy gpt-oss-20B jest łatwiejszy we wdrożeniu i idealny do typowych zastosowań produkcyjnych przy mniejszych nakładach finansowych.

Wdrożenie gpt-oss-20B w polskim startupie EduAI

EduAI, startup z Krakowa, tworzy platformę do automatycznego oceniania wypracowań szkolnych. Początkowo korzystali z API GPT-4, ale przy 10 000 użytkowników miesięcznie koszty API sięgały 15 000 zł. Zespół obawiał się, że przejście na model open source może obniżyć jakość ocen.

Pierwsza próba wdrożenia gpt-oss-20B na jednej karcie RTX 4090 zakończyła się porażką – model odpowiadał zbyt wolno (ponad 10 sekund na wypracowanie), a kwantyzacja 4-bit powodowała czasem utratę spójności w dłuższych tekstach.

Zespół zoptymalizował pipeline: zastosował vLLM z batch processingiem, skorzystał z techniki prompt caching, a także dostroił model na własnym zbiorze 5000 polskich wypracowań. Kluczową zmianą było użycie dwóch kart RTX 4090 z równoległością tensorową.

Efekt: średni czas oceny spadł do 2,5 sekundy, a dokładność (mierzona zgodnością z ocenami nauczycieli) wzrosła do 91%, przewyższając wyniki GPT-4 na tym samym zbiorze. Miesięczne koszty infrastruktury to 3500 zł – o 77% mniej niż wcześniejsze API. Startup uniezależnił się też od zewnętrznych dostawców.

Jeśli interesują Cię kwestie własności technologicznej, sprawdź też, czy Chatgpt jest oprogramowaniem typu open source?

Dalsza lektura

Czy mogę użyć gpt-oss w mojej aplikacji komercyjnej bez płacenia OpenAI?

Tak, licencja Apache 2.0 pozwala na nieograniczone wykorzystanie komercyjne, w tym w zamkniętych produktach. Jedyny warunek to zachowanie informacji o licencji w dokumentacji lub kodzie.

Który model wybrać, jeśli mam tylko jeden GPU RTX 4090?

Wybierz gpt-oss-20B – po kwantyzacji do 4-bit mieści się na 24 GB VRAM i działa w czasie rzeczywistym. Model 120B wymaga co najmniej 80 GB VRAM, nawet po kompresji.

Czy modele gpt-oss są dostępne na Hugging Face?

Tak, oficjalne repozytoria to „openai/gpt-oss-120B” i „openai/gpt-oss-20B”. Można je pobrać bezpośrednio za pomocą biblioteki transformers.

Czy te modele są lepsze od GPT-4?

W niektórych benchmarkach (np. kodowanie, rozumowanie) gpt-oss-120B dorównuje GPT-4, a w zadaniach związanych z językiem polskim – po fine‑tuningu – może go przewyższać. GPT-4 pozostaje bardziej wszechstronny i łatwiejszy we wdrożeniu przez API.

Jakie są minimalne wymagania RAM dla uruchomienia gpt-oss-20B?

Do załadowania modelu w 4-bit potrzebujesz ok. 12 GB VRAM. Do komfortowej pracy (batch size 1) wystarczy 16 GB VRAM, ale zaleca się 24 GB, aby obsłużyć także kontekst o długości 8192 tokenów.

Najważniejsze rzeczy

OpenAI udostępniło dwa w pełni otwarte modele GPT

gpt-oss-120B i gpt-oss-20B są dostępne na licencji Apache 2.0, co oznacza swobodę użytkowania komercyjnego i modyfikacji.

Wybierz model w zależności od zasobów sprzętowych

120B wymaga klastra GPU (min. 80 GB VRAM), 20B działa na jednej karcie RTX 4090 po kwantyzacji.

Licencja Apache 2.0 nie ogranicza zastosowań biznesowych

Możesz budować własne produkty SaaS bez ryzyka prawnego, pod warunkiem dołączenia noty licencyjnej.

Uruchomienie lokalne jest łatwe dzięki vLLM i kwantyzacji

Biblioteki takie jak bitsandbytes i vLLM pozwalają osiągnąć wydajność porównywalną z API przy ułamku kosztów.

Polskie zastosowania komercyjne już przynoszą oszczędności

Przykład startupu EduAI pokazuje 77% redukcję kosztów i lepszą kontrolę nad danymi po migracji na gpt-oss-20B.

Odwołania Krzyżowe

  • [2] Huggingface - 120 miliardów – w trybie Mixture of Experts (MoE) aktywowanych jest tylko około 20 miliardów na każde zapytanie
  • [4] Apxml - Po kwantyzacji do 4-bit (np. za pomocą AutoGPTQ) można zmieścić się na 60–80 GB VRAM
  • [5] Huggingface - 20 miliardów – klasyczna gęsta architektura, wszystkie parametry aktywowane przy każdym zapytaniu.
  • [7] Huggingface - Po kwantyzacji do 4-bit wystarczy 10–12 GB VRAM