ბოლო ერთი წლის განმავლობაში, საზოგადოება უფრო და უფრო მეტად აცნობიერებს, რომ დიდი ენობრივი მოდელების (LLM) გამოყენებას ტექსტის გენერირებისთვის მნიშვნელოვანი გარემოზე ზემოქმედება აქვს, რაც სცილდება წვრთნის (training) ისედაც არსებულ მნიშვნელოვან გავლენას. ბოლოდროინდელი კვლევები (იხილეთ სტატია „უფრო მწვანე LLM-ებისკენ“) ხაზს უსვამს რესურსების ეფექტურად მართვის გამოწვევებს ინფერენციის ფაზაში დინამიური და მრავალფეროვანი დატვირთვის გამო. Open LLM Leaderboard-ში ნახშირბადის ემისიის შეფასებების ინტეგრირებით, ჩვენ მიზნად ვისახავთ მომხმარებლებისთვის გამჭვირვალობის უზრუნველყოფას სხვადასხვა მოდელის შეფასების ნახშირბადის კვალთან დაკავშირებით და იმედი გვაქვს, რომ წავახალისებთ მოდელების შემქმნელებს, დააბალანსონ შესრულება გარემოსდაცვით პასუხისმგებლობასთან. ჩვენ გვაინტერესებდა მოდელის ინფერენციასთან დაკავშირებული CO₂ ემისიების შესწავლა და მონაცემებში რაიმე ახალი ტენდენციების იდენტიფიცირება. ამ პროცესში, ჩვენ აღმოვაჩინეთ რამდენიმე პროგნოზირებადი ნიმუში, მაგრამ ასევე გამოვავლინეთ რამდენიმე მოულოდნელი შეხედულება, მაგალითად, რომ საზოგადოების მიერ მორგებული მოდელები (community fine-tunes) ზოგადად უფრო ნახშირბადეფექტურია! 💡 შენიშვნა: ჩვენ შევქმენით Colab ნოუთბუქი, რომელიც შეიცავს აქ განხილულ ყველა მონაცემს და აღმოჩენას. ეს ნოუთბუქი საშუალებას გაძლევთ შეისწავლოთ შედეგები, თავად ჩაატაროთ ანალიზი და მოარგოთ კოდი შემდგომი კითხვების შესასწავლად. მოდით, უფრო დეტალურად განვიხილოთ, თუ როგორ ვანგარიშობთ CO₂ ემისიებს, რომლებიც წარმოიქმნება მოდელის ინფერენციის დროს. ჩვენს შემთხვევაში, ვიყენებთ მარტივ ევრისტიკულ მიდგომას, რადგან ყველა შეფასება ხორციელდება ერთსა და იმავე აპარატურაზე ერთი მეთოდის გამოყენებით (მეთოდი: მოდელის ჩატვირთვა Transformers-ით და Accelerate-ით, კონვეიერული პარალელიზმისა და მონაცემთა პარალელიზმის კომბინაციის გამოყენებით, რათა სრულად გამოვიყენოთ ჩვენი 8 GPU თითო კვანძზე). იგი მოიცავს ფაქტორების გათვალისწინებას: დეტალური განმარტება და ფორმულა შეგიძლიათ იხილოთ ჩვენს დოკუმენტაციაში. გაფრთხილება: ეს არ ნიშნავს, რომ მოდელი X ზოგადად გამოყოფს Y CO₂-ს ინფერენციისას! სამაგიეროდ, ეს ნიშნავს, რომ მოდელმა X-მა გამოყო Y CO₂ ჩვენს ძალიან სპეციფიკურ ინფერენციის დაყენებაზე და ამით მაინც ბევრი რამის სწავლა შეგიძლიათ 😀 ვინაიდან ზოგადი ტენდენციების დადგენა გვინდოდა, ჩვენ მხოლოდ ყველაზე ხშირ მოდელის არქიტექტურებს და იმ მოდელებს განვიხილავდით, რომელთათვისაც პარამეტრების რაოდენობა გვქონდა. ამრიგად, ჩვენ შევისწავლეთ 2,742 მოდელი რამდენიმე ბოლოდროინდელი ოჯახიდან: Gemma/Gemma2, Llama-ს ყველა თაობა, Mistral, Mixtral, ასევე Phi/Phi3, Qwen2 და ზემოთ. ჩვენ ასევე ჩავრთეთ ძველი მოდელის ოჯახები, როგორიცაა GPT, GPT-NeoX და T5. ოფიციალური მოდელები მოდის მაღალი ხარისხის სანდო მოდელების შემქმნელებისგან, როგორიცაა კვლევითი ჯგუფები ან საზოგადოებრივი კონსორციუმები (EleutherAI, NousResearch), FAANG (Google, Meta, Alibaba…), სტარტაპები (MistralAI, 01.AI) და ა.შ., რომლებმაც დახარჯეს დრო და გამოთვლითი რესურსი ახალი, მაღალი ხარისხის მოდელების შესაქმნელად. ისინი წარმოადგენენ 341 მოდელს. ვინაიდან საზოგადოება ძირითადად მცირე მოდელებზეა ორიენტირებული, ის ახერხებს მიაღწიოს საშუალოდ 35 ქულას (საუკეთესო ქულები დაახლოებით 45-ია) 10 მილიარდზე ნაკლები პარამეტრის მქონე მოდელებისთვის, 5 კგ-ზე ნაკლები CO₂-ის დახარჯვით! თუმცა, საინტერესოა, რომ CO₂ ემისიების ტენდენცია მოდელის ზომასთან მიმართებაში, მაღალი მნიშვნელობების შემთხვევაშიც კი, არ არის იგივე საზოგადოებრივ და ოფიციალურ გამოცემებს შორის: საზოგადოების მიერ მორგებული მოდელები (community fine-tunes) ან შერწყმები უფრო CO₂-ეფექტურია, ვიდრე ის ოფიციალური მოდელები, რომლებიდანაც ისინი იწყებენ! მოდით, უფრო ღრმად ჩავუღრმავდეთ ამ აღმოჩენას! დეტალურად განვიხილოთ მაღალპარამეტრული და კომპაქტური (> 7 მილიარდი პარამეტრი) საბაზისო მოდელები, თითოეული კატეგორიიდან სამ მათგანზე ფოკუსირებით. ჩვენ შევისწავლით ემისიებს თითოეული საბაზისო მოდელისთვის, სხვა ოფიციალური დაზუსტებული მოდელებისთვის, მათ შორის ოფიციალური „instruct“ ვერსიებისთვის, და საზოგადოების მიერ შექმნილი დაზუსტებული მოდელებისთვის. პირველ რიგში, განვიხილოთ სამი 70 მილიარდპარამეტრიანი მოდელი, შევადაროთ საბაზისო მოდელის, მისი ოფიციალური დაზუსტებული მოდელების და საზოგადოების მიერ შექმნილი დაზუსტებული მოდელების საშუალო CO₂ მოხმარება. საერთო ჯამში, Qwen2.5-ისა და Llama3.1-ისთვის, საბაზისო მოდელები და საზოგადოების მიერ შექმნილი დაზუსტებული მოდელები მიდრეკილნი არიან მსგავსი CO₂ ემისიების გამოვლენისკენ, მაგრამ ოფიციალური დაზუსტებული მოდელები ორჯერ მეტ ენერგიას მოიხმარენ. საინტერესოა, რომ Qwen2-ისთვის საბაზისო მოდელი მნიშვნელოვნად უფრო ენერგოტევადია, ვიდრე მისი დაზუსტებული ვერსიები. საზოგადოების მიერ შექმნილი დაზუსტებული მოდელების მაღალი შესრულება შეიძლება მიეწეროს მათ ბენჩმარკზე სპეციფიკურ ადაპტაციებს, რაც იწვევს უფრო მოკლე გამოსავალს და ენერგიის შემცირებულ მოხმარებას. როდესაც 7B+ მოდელებს ანალოგიურად ვამოწმებთ, ვამჩნევთ, რომ არ არსებობს თანმიმდევრული ტენდენცია. Llama3.1-ისა და Qwen2.5-ისთვის, საბაზისო მოდელები ორჯერ მეტს მოიხმარენ, ვიდრე დაზუსტებული მოდელები. Qwen2-სა და Mistral v0.3-ისთვის, საზოგადოების მიერ შექმნილი დაზუსტებული მოდელების მოხმარება უფრო მაღალია. მნიშვნელოვანი განსხვავება Qwen2-72B-ში საბაზისო მოდელსა და საზოგადოების მიერ შექმნილ დაზუსტებულ მოდელებს შორის აჩენს საინტერესო კითხვებს სიტყვიერებასა თუ ტექსტის ხარისხში პოტენციური განსხვავებების შესახებ. საბაზისო მოდელი მნიშვნელოვნად მაღალ CO₂ ემისიებს აჩვენებს მის დაზუსტებულ ვერსიებთან შედარებით, მაშინ როცა საზოგადოების მიერ შექმნილი დაზუსტებული მოდელები გაცილებით დაბალ ემისიებს ავლენენ. ჩვენ შეგვიძლია შევადაროთ ეს სამი მოდელი ჩვენი შედარების ხელსაწყოს გამოყენებით: Qwen/Qwen2-72B (საბაზისო მოდელი) Qwen/Qwen2-72B-Instruct (ოფიციალური დაზუსტებული მოდელი) MaziyarPanahi/calme-2.1-qwen2-72b (საზოგადოების მიერ შექმნილი დაზუსტებული მოდელი). სამწუხაროდ, CO₂ დანახარჯები თითოეული ამოცანისთვის ხელმისაწვდომი არ არის, ამიტომ გაუგებარია, აქვს თუ არა ზოგიერთ ამოცანას არაპროპორციულად დიდი გავლენა. თუმცა, ვიცით, რომ გენერაციული ამოცანები, როგორც წესი, უფრო ძვირია, რადგან ისინი მოითხოვს უფრო მეტი ტოკენის ინფერენციას, ვიდრე მრავალპასუხიანი ამოცანები. ამის გათვალისწინებით, ჩვენ შევაფასეთ ამ სამი მოდელის გენერაციული შესაძლებლობები და შევადარეთ...