Które GPT są open source?
Które gpt są open source? Gpt-oss 120b vs 20b
Pytanie o które gpt są open source nabiera znaczenia w kontekście prywatności danych i kontroli nad technologią. Samodzielne hostowanie modeli pozwala uniknąć opłat subskrypcyjnych oraz chroni wrażliwe informacje. Zrozumienie dostępnych licencji chroni przed naruszeniami prawnymi. Warto poznać szczegóły techniczne, aby zoptymalizować pracę własnej infrastruktury AI.
Najczęściej zadawane pytania o open source GPT
Porównanie gpt-oss-120B i gpt-oss-20B
Oba modele opublikowano na Hugging Face, ale ich przeznaczenie i wymagania są zupełnie inne.
gpt-oss-120B (Mixture of Experts)
- Do uruchomienia w pełnej precyzji FP16 potrzeba ok. 240 GB VRAM. Po kwantyzacji do 4-bit (np. za pomocą AutoGPTQ) można zmieścić się na 60–80 GB VRAM – [4] to wymaga co najmniej dwóch kart H100 lub jednej A100 80GB.
- Idealny do zadań wymagających głębokiej wiedzy, generowania długich dokumentów, analizy dużych zbiorów danych oraz zastosowań badawczych, gdzie precyzja i bogactwo odpowiedzi są kluczowe.
- Dzięki architekturze MoE generuje tokeny szybciej niż model gęsty o tej samej liczbie parametrów – typowo 1,5–2 razy szybciej w porównaniu z hipotetycznym gęstym modelem 120B.
- 120 miliardów – w trybie Mixture of Experts (MoE) aktywowanych jest tylko około 5 miliardów na każde zapytanie [2], co pozwala zachować wydajność przy ogromnej pojemności wiedzy.
gpt-oss-20B (Dense)
- W FP16 potrzeba ok. 40 GB VRAM. Po kwantyzacji do 4-bit wystarczy 10–12 GB VRAM – [7] można uruchomić nawet na jednej karcie RTX 4090 (24 GB) lub dwóch RTX 3090.
- Sprawdzi się w zastosowaniach produkcyjnych z ograniczonym budżetem sprzętowym: chatboty, asystenci programistów, systemy RAG na średniej wielkości danych.
- Działa szybko na sprzęcie konsumenckim – z 4-bitową kwantyzacją osiąga 30–50 tokenów/s na RTX 4090, co wystarcza do interakcji w czasie rzeczywistym.
- 20 miliardów – klasyczna gęsta architektura, wszystkie parametry aktywowane przy każdym zapytaniu [5].
Wdrożenie gpt-oss-20B w polskim startupie EduAI
EduAI, startup z Krakowa, tworzy platformę do automatycznego oceniania wypracowań szkolnych. Początkowo korzystali z API GPT-4, ale przy 10 000 użytkowników miesięcznie koszty API sięgały 15 000 zł. Zespół obawiał się, że przejście na model open source może obniżyć jakość ocen.
Pierwsza próba wdrożenia gpt-oss-20B na jednej karcie RTX 4090 zakończyła się porażką – model odpowiadał zbyt wolno (ponad 10 sekund na wypracowanie), a kwantyzacja 4-bit powodowała czasem utratę spójności w dłuższych tekstach.
Zespół zoptymalizował pipeline: zastosował vLLM z batch processingiem, skorzystał z techniki prompt caching, a także dostroił model na własnym zbiorze 5000 polskich wypracowań. Kluczową zmianą było użycie dwóch kart RTX 4090 z równoległością tensorową.
Efekt: średni czas oceny spadł do 2,5 sekundy, a dokładność (mierzona zgodnością z ocenami nauczycieli) wzrosła do 91%, przewyższając wyniki GPT-4 na tym samym zbiorze. Miesięczne koszty infrastruktury to 3500 zł – o 77% mniej niż wcześniejsze API. Startup uniezależnił się też od zewnętrznych dostawców.
Dalsza lektura
Czy mogę użyć gpt-oss w mojej aplikacji komercyjnej bez płacenia OpenAI?
Tak, licencja Apache 2.0 pozwala na nieograniczone wykorzystanie komercyjne, w tym w zamkniętych produktach. Jedyny warunek to zachowanie informacji o licencji w dokumentacji lub kodzie.
Który model wybrać, jeśli mam tylko jeden GPU RTX 4090?
Wybierz gpt-oss-20B – po kwantyzacji do 4-bit mieści się na 24 GB VRAM i działa w czasie rzeczywistym. Model 120B wymaga co najmniej 80 GB VRAM, nawet po kompresji.
Czy modele gpt-oss są dostępne na Hugging Face?
Tak, oficjalne repozytoria to „openai/gpt-oss-120B” i „openai/gpt-oss-20B”. Można je pobrać bezpośrednio za pomocą biblioteki transformers.
Czy te modele są lepsze od GPT-4?
W niektórych benchmarkach (np. kodowanie, rozumowanie) gpt-oss-120B dorównuje GPT-4, a w zadaniach związanych z językiem polskim – po fine‑tuningu – może go przewyższać. GPT-4 pozostaje bardziej wszechstronny i łatwiejszy we wdrożeniu przez API.
Jakie są minimalne wymagania RAM dla uruchomienia gpt-oss-20B?
Do załadowania modelu w 4-bit potrzebujesz ok. 12 GB VRAM. Do komfortowej pracy (batch size 1) wystarczy 16 GB VRAM, ale zaleca się 24 GB, aby obsłużyć także kontekst o długości 8192 tokenów.
Najważniejsze rzeczy
OpenAI udostępniło dwa w pełni otwarte modele GPTgpt-oss-120B i gpt-oss-20B są dostępne na licencji Apache 2.0, co oznacza swobodę użytkowania komercyjnego i modyfikacji.
Wybierz model w zależności od zasobów sprzętowych120B wymaga klastra GPU (min. 80 GB VRAM), 20B działa na jednej karcie RTX 4090 po kwantyzacji.
Licencja Apache 2.0 nie ogranicza zastosowań biznesowychMożesz budować własne produkty SaaS bez ryzyka prawnego, pod warunkiem dołączenia noty licencyjnej.
Uruchomienie lokalne jest łatwe dzięki vLLM i kwantyzacjiBiblioteki takie jak bitsandbytes i vLLM pozwalają osiągnąć wydajność porównywalną z API przy ułamku kosztów.
Polskie zastosowania komercyjne już przynoszą oszczędnościPrzykład startupu EduAI pokazuje 77% redukcję kosztów i lepszą kontrolę nad danymi po migracji na gpt-oss-20B.
Odwołania Krzyżowe
- [2] Huggingface - 120 miliardów – w trybie Mixture of Experts (MoE) aktywowanych jest tylko około 20 miliardów na każde zapytanie
- [4] Apxml - Po kwantyzacji do 4-bit (np. za pomocą AutoGPTQ) można zmieścić się na 60–80 GB VRAM
- [5] Huggingface - 20 miliardów – klasyczna gęsta architektura, wszystkie parametry aktywowane przy każdym zapytaniu.
- [7] Huggingface - Po kwantyzacji do 4-bit wystarczy 10–12 GB VRAM
- Ile trwa aktualizacja PKK po egzaminie teoretycznym?
- Kiedy WORD zwraca PKK?
- Ile czasu WORD zwalnia PKK?
- Komu należą się bilety ulgowe?
- Jak dodać pole wyboru „tak lub „nie w programie Excel?
- Jak wstawić w Excelu pole wyboru tak lub nie?
- Jakie kursy walut należy zastosować do przeliczenia VAT?
- Czy wartość niematerialną i prawną jest środkiem trwałym?
- Jak wstawić Pole wyboru w Excelu?
- Jak w Excelu zrobić tak nie?
Skomentuj odpowiedź:
Dziękujemy za Twoją opinię! Twój komentarz pomaga nam ulepszać odpowiedzi w przyszłości.