იმისთვის, რომ მოდელები კიდევ უფრო გაუმჯობესებული და საზოგადოებისთვის მეტად ეფექტური ყოფილიყო, ისინი ლიცენზირებულია Apache 2.0 ლიცენზიით, გამოყენების მინიმალური პოლიტიკის პარალელურად: ჩვენი მიზანია, რომ ჩვენი ხელსაწყოები გამოყენებულ იქნას უსაფრთხოდ, პასუხისმგებლობით და დემოკრატიულად, თქვენი კონტროლის მაქსიმიზაციის პარალელურად. gpt-oss-ის გამოყენებით, თქვენ ეთანხმებით ყველა მოქმედ კანონმდებლობას. OpenAI-ის ცნობით, ეს გამოშვება მნიშვნელოვანი ნაბიჯია მათი ვალდებულების შესრულებაში ღია კოდის ეკოსისტემის მიმართ, რაც შეესაბამება მათ გაცხადებულ მისიას, ხელოვნური ინტელექტის უპირატესობები ფართოდ ხელმისაწვდომი გახადონ. მრავალი გამოყენების შემთხვევა ეფუძნება კერძო და/ან ლოკალურ განლაგებებს, და ჩვენ, Hugging Face-ში, ძალიან მოხარულები ვართ მივესალმოთ OpenAI-ს საზოგადოებაში. ჩვენ გვჯერა, რომ ეს იქნება ხანგრძლივი, შთამაგონებელი და გავლენიანი მოდელები. **არქიტექტურა** OpenAI GPT OSS მოდელები ხელმისაწვდომია Hugging Face-ის Inference Providers სერვისის მეშვეობით, რაც საშუალებას გაძლევთ გაგზავნოთ მოთხოვნები ნებისმიერ მხარდაჭერილ პროვაიდერთან ერთი და იგივე JavaScript ან Python კოდის გამოყენებით. ეს არის იგივე ინფრასტრუქტურა, რომელიც ამუშავებს OpenAI-ის ოფიციალურ დემოს gpt-oss.com-ზე, და შეგიძლიათ გამოიყენოთ იგი თქვენი საკუთარი პროექტებისთვის. ქვემოთ მოცემულია მაგალითი, რომელიც იყენებს Python-ს და სუპერსწრაფ Cerebras პროვაიდერს. დამატებითი ინფორმაციისა და სხვა კოდის ფრაგმენტებისთვის, იხილეთ inference providers განყოფილება მოდელის ბარათებში და სპეციალური სახელმძღვანელო, რომელიც ამ მოდელებისთვის შევიმუშავეთ. Inference Providers ასევე ახორციელებს OpenAI-თან თავსებად Responses API-ს, ჩატის მოდელებისთვის OpenAI-ის ყველაზე მოწინავე ინტერფეისს, რომელიც შექმნილია უფრო მოქნილი და ინტუიციური ურთიერთქმედებისთვის. ქვემოთ მოცემულია მაგალითი Responses API-ის გამოყენებით Fireworks AI პროვაიდერთან. დამატებითი დეტალებისთვის იხილეთ ღია კოდის responses.js პროექტი. თქვენ უნდა დააინსტალიროთ transformers-ის უახლესი ვერსია (v4.55.1 ან უფრო ახალი), ასევე accelerate და kernels. ასევე გირჩევთ დააინსტალიროთ triton 3.4 ან უკეთესი, რადგან ის ხსნის mxfp4 კვანტიზაციის მხარდაჭერას CUDA აპარატურაზე: მოდელის წონები კვანტიზებულია mxfp4 ფორმატში, რომელიც თავდაპირველად ხელმისაწვდომი იყო Hopper-ის ან Blackwell-ის ოჯახის GPU-ებზე, მაგრამ ახლა მუშაობს წინა CUDA არქიტექტურებზე (მათ შორის Ada, Ampere და Tesla). triton 3.4-ის, kernels ბიბლიოთეკასთან ერთად, დაყენება შესაძლებელს ხდის ოპტიმიზებული mxfp4 ქერნელების ჩამოტვირთვას პირველივე გამოყენებისას, რაც უზრუნველყოფს მეხსიერების დიდ დაზოგვას. ამ კომპონენტების არსებობის შემთხვევაში, შეგიძლიათ გაუშვათ 20B მოდელი 16 GB ოპერატიული მეხსიერების მქონე GPU-ებზე. ეს მოიცავს ბევრ სამომხმარებლო ბარათს (3090, 4090, 5080), ასევე Colab-სა და Kaggle-ს! თუ წინა ბიბლიოთეკები არ არის დაინსტალირებული (ან არ გაქვთ თავსებადი GPU), მოდელის ჩატვირთვა გადავა bfloat16-ზე, კვანტიზებული წონებისგან ამოფუთულ მდგომარეობაში. შემდეგი კოდის ფრაგმენტი აჩვენებს მარტივ ინფერენციას 20B მოდელით. როგორც განმარტებულია, ის მუშაობს 16 GB GPU-ებზე mxfp4-ის გამოყენებისას, ან ~48 GB-ზე bfloat16-ში. მოდელები იყენებენ attention sinks-ს, ტექნიკას, რომელიც vLLM გუნდმა Flash Attention 3-თან თავსებადი გახადა. ჩვენ შევფუთეთ და ინტეგრირდით მათი ოპტიმიზებული ქერნელი kernels-community/vllm-flash-attn3-ში. ამ წერილის მომზადების მომენტში, ეს სუპერსწრაფი ქერნელი ტესტირებულია Hopper ბარათებზე PyTorch 2.7 და 2.8-ით. ველით გაზრდილ მხარდაჭერას უახლოეს დღეებში. თუ მოდელებს გაუშვებთ Hopper ბარათებზე (მაგალითად, H100 ან H200), თქვენ უნდა დააინსტალიროთ `pip install --upgrade kernels` და დაამატოთ შემდეგი ხაზი თქვენს კოდის ფრაგმენტს: ეს კოდის ფრაგმენტი ჩამოტვირთავს ოპტიმიზებულ, წინასწარ კომპილირებულ ქერნელის კოდს kernels-community-დან, როგორც ეს ჩვენს წინა ბლოგ პოსტში იყო განმარტებული. transformers გუნდმა შექმნა, შეფუთა და გამოსცადა კოდი, ამიტომ მისი გამოყენება სრულიად უსაფრთხოა. გირჩევთ გამოიყენოთ mxfp4, თუ თქვენი GPU მხარს უჭერს მას. თუ დამატებით შეგიძლიათ გამოიყენოთ Flash Attention 3, მაშინ აუცილებლად ჩართეთ! თუ თქვენი GPU არ არის mxfp4-თან თავსებადი, მაშინ გირჩევთ გამოიყენოთ MegaBlocks MoE ქერნელები წარმადობის გასაუმჯობესებლად. ამისათვის, თქვენ უბრალოდ უნდა შეცვალოთ თქვენი ინფერენციის კოდი ასე: MegaBlocks-ის ოპტიმიზებული MoE ქერნელები მოითხოვს მოდელის bfloat16-ზე გაშვებას, ამიტომ მეხსიერების მოხმარება უფრო მაღალი იქნება, ვიდრე mxfp4-ზე გაშვებისას. გირჩევთ გამოიყენოთ mxfp4, თუ შეგიძლიათ, წინააღმდეგ შემთხვევაში აირჩიეთ MegaBlocks `use_kernels=True`-ის მეშვეობით. OpenAI GPT OSS შემოწმებულია AMD Instinct აპარატურაზე და მოხარულები ვართ განვაცხადოთ AMD-ის ROCm პლატფორმის საწყისი მხარდაჭერის შესახებ ჩვენს kernels ბიბლიოთეკაში, რაც საფუძველს უქმნის Transformers-ში მომავალ ოპტიმიზებულ ROCm ქერნელებს. MegaBlocks MoE ქერნელის აჩქარება უკვე ხელმისაწვდომია OpenAI GPT OSS-ისთვის AMD Instinct-ზე (მაგ., MI300-სერია), რაც უზრუნველყოფს უკეთეს ვარჯიშისა და ინფერენციის წარმადობას. შეგიძლიათ გამოსცადოთ ის ზემოთ მოცემული იგივე ინფერენციის კოდით. AMD-მ ასევე მოამზადა Hugging Face Space მომხმარებლებისთვის, რათა გამოსცადონ მოდელი AMD აპარატურაზე. ამ წერილის მომზადების მომენტში, ეს ცხრილი აჯამებს ჩვენს რეკომენდაციებს GPU-ს თავსებადობისა და ჩვენი ტესტების საფუძველზე. ველით, რომ Flash Attention 3 (sink attention-ით) თავსებადი გახდება დამატებით GPU-ებთან. მიუხედავად იმისა, რომ 120B მოდელი ეტევა ერთ H100 GPU-ზე (mxfp4-ის გამოყენებით), მისი მარტივად გაშვება ასევე შეგიძლიათ მრავალ GPU-ზე accelerate ან torchrun-ის გამოყენებით. Transformers გთავაზობთ ნაგულისხმევ პარალელიზაციის გეგმას, და ასევე შეგიძლიათ გამოიყენოთ ოპტიმიზებული attention ქერნელები. შემდეგი კოდის ფრაგმენტი შეიძლება გაეშვას `torchrun --nproc_per_node=4 generate.py`-ით სისტემაზე.