დიდი ენობრივი მოდელების (LLMs) ნახშირბადის კვალი: ოფიციალური ვერსიები vs. საზოგადოებრივი „ფაინ-ტიუნები“
ბოლო ერთი წლის განმავლობაში, გაიზარდა ცნობიერება იმის შესახებ, რომ დიდი ენობრივი მოდელების (LLMs) გამოყენებას ტექსტის გენერირებისთვის მნიშვნელოვანი გარემოსდაცვითი გავლენა აქვს, განსაკუთრებით ინფერენციის ფაზაში. Open LLM Leaderboard-ში ნახშირბადის ემისიების შეფასებების ინტეგრირებით, მიზანია გამჭვირვალობის უზრუნველყოფა და მოდელების შემქმნელების წახალისება, დააბალანსონ შესრულება გარემოსდაცვით პასუხისმგებლობასთან. კვლევამ გამოავლინა, რომ საზოგადოების მიერ შექმნილი „ფაინ-ტიუნები“ ხშირად უფრო ნახშირბა
ბოლო ერთი წლის განმავლობაში, ადამიანები სულ უფრო მეტად აცნობიერებენ, რომ დიდი ენობრივი მოდელების (LLMs) ტექსტის გენერირებისთვის გამოყენებას მნიშვნელოვანი გარემოსდაცვითი გავლენა აქვს, უკვე არსებულ სასწავლო პროცესის მნიშვნელოვან გავლენასთან ერთად. ბოლო კვლევები (იხილეთ სტატია „Towards Greener LLMs“) ხაზს უსვამს ინფერენციის დროს რესურსების ეფექტურად მართვის გამოწვევებს დინამიური და მრავალფეროვანი დატვირთვების გამო. Open LLM Leaderboard-ში ნახშირბადის ემისიების შეფასებების ინტეგრირებით, ჩვენი მიზანია მომხმარებლებისთვის გამჭვირვალობის უზრუნველყოფა სხვადასხვა მოდელის შეფასებების ნახშირბადის კვალთან დაკავშირებით და ვიმედოვნებთ, რომ ეს წაახალისებს მოდელების შემქმნელებს, დააბალანსონ შესრულება გარემოსდაცვით პასუხისმგებლობასთან. ჩვენ გვაინტერესებდა მოდელის ინფერენციასთან დაკავშირებული CO₂ ემისიების შესწავლა და მონაცემებში რაიმე ახალი ტენდენციების იდენტიფიცირება. ამ გზაზე, ჩვენ ვნახეთ რამდენიმე პროგნოზირებადი ნიმუში, მაგრამ ასევე აღმოვაჩინეთ მოულოდნელი დასკვნები, მაგალითად, რომ საზოგადოების მიერ შექმნილი „ფაინ-ტიუნები“ ზოგადად უფრო ნახშირბად-ეფექტურია! 💡 შენიშვნა: ჩვენ შევქმენით Colab ნოუთბუქი, რომელიც შეიცავს ყველა განხილულ მონაცემს და დასკვნას. ეს ნოუთბუქი საშუალებას გაძლევთ შეისწავლოთ შედეგები, თავად გაუშვათ ანალიზი და მოარგოთ კოდი შემდგომი კითხვების შესასწავლად.
მოდით, უფრო დეტალურად განვიხილოთ, თუ როგორ ვიანგარიშებთ მოდელის ინფერენციის დროს გამომუშავებულ CO₂ ემისიებს. ჩვენს შემთხვევაში, ვიყენებთ მარტივ ჰევრისტიკას, რადგან ყველა შეფასება ხორციელდება ერთსა და იმავე აპარატურაზე ერთი და იგივე მეთოდის გამოყენებით (მეთოდი: მოდელის ჩატვირთვა Transformers-ით და Accelerate-ით, კონვეიერული პარალელიზმისა და მონაცემთა პარალელიზმის კომბინაციის გამოყენებით ჩვენი 8 GPU-ის სრულად გამოსაყენებლად თითო კვანძზე). ეს მოიცავს შემდეგ ფაქტორებს: დეტალური განმარტება და ფორმულა შეგიძლიათ იხილოთ ჩვენს დოკუმენტაციაში. გაფრთხილება: ეს არ ნიშნავს, რომ მოდელი X ზოგადად Y CO₂-ს გამოყოფს ინფერენციისას! სამაგიეროდ, ეს ნიშნავს, რომ მოდელმა X-მა გამოყო Y CO₂ ჩვენს ძალიან სპეციფიკურ ინფერენციის დაყენებაზე, და ამისგან მაინც ბევრის სწავლა შეგიძლიათ 😀. იმის გამო, რომ ზოგადი ტენდენციების შესწავლა გვინდოდა, ჩვენ მხოლოდ ყველაზე ხშირად გამოყენებული მოდელის არქიტექტურები და მოდელები განვიხილეთ, რომელთათვისაც პარამეტრების რაოდენობა გვქონდა.
ამიტომ, ჩვენ შევისწავლეთ 2,742 მოდელი რამდენიმე უახლესი ოჯახიდან: Gemma/Gemma2, Llama-ს ყველა თაობა, Mistral, Mixtral, ასევე Phi/Phi3, Qwen2 და ზემოთ. ჩვენ ასევე შევიტანეთ ძველი მოდელის ოჯახები, როგორიცაა GPT, GPT-NeoX და T5. ოფიციალური მოდელები მოდის მაღალი ხარისხის სანდო შემქმნელებისგან, როგორიცაა კვლევითი ჯგუფები ან საზოგადოებრივი კონსორციუმები (EleutherAI, NousResearch), FAANG (Google, Meta, Alibaba…), სტარტაპები (MistralAI, 01.AI) და ა.შ., რომლებმაც დახარჯეს დრო და გამოთვლითი რესურსი ახალი, მაღალი ხარისხის მოდელების შესაქმნელად. ისინი წარმოადგენს 341 მოდელს.
იმის გამო, რომ საზოგადოება ძირითადად მცირე მოდელებზეა ორიენტირებული, ის ახერხებს მიაღწიოს საშუალო ქულას 35-ს (საუკეთესო ქულები დაახლოებით 45-ია) 10 მილიარდზე ნაკლები პარამეტრის მქონე მოდელებისთვის, 5 კგ CO₂-ზე ნაკლები ემისიით! თუმცა, საინტერესოა, რომ CO₂ ემისიების ტენდენცია მოდელის ზომასთან მიმართებაში, თუნდაც მაღალი მნიშვნელობებისას, არ არის იგივე საზოგადოებრივ და ოფიციალურ გამოშვებებს შორის: საზოგადოების მიერ შექმნილი „ფაინ-ტიუნები“ ან „მერჯები“ უფრო CO₂ ეფექტურია, ვიდრე ოფიციალური მოდელები, საიდანაც ისინი იწყება!
მოდით, უფრო დეტალურად განვიხილოთ ეს აღმოჩენა! მოდით, ყურადღებით შევისწავლოთ მაღალპარამეტრიანი და კომპაქტური (> 7 მილიარდი პარამეტრი) საბაზისო მოდელები, ფოკუსირება მოვახდინოთ სამზე თითოეული კატეგორიისთვის. ჩვენ შევისწავლით ემისიებს თითოეული საბაზისო მოდელისთვის, სხვა ოფიციალური „ფაინ-ტიუნებისთვის“, მათ შორის ოფიციალური ინსტრუქტორული ვერსიებისთვის, და საზოგადოებრივი „ფაინ-ტიუნებისთვის“. პირველ რიგში, განვიხილოთ სამი 70B მოდელი, შევადაროთ საბაზისო, მისი ოფიციალური „ფაინ-ტიუნების“ და საზოგადოებრივი „ფაინ-ტიუნების“ საშუალო CO₂ მოხმარება. საერთო ჯამში, Qwen2.5-ისა და Llama3.1-ისთვის, საბაზისო მოდელებსა და საზოგადოებრივ „ფაინ-ტიუნებს“ მსგავსი CO₂ ემისიები აქვთ, თუმცა ოფიციალური „ფაინ-ტიუნები“ ორჯერ მეტ ენერგიას მოიხმარენ. საინტერესოა, რომ Qwen2-ისთვის, საბაზისო მოდელი მნიშვნელოვნად უფრო ენერგოტევადია, ვიდრე მისი „ფაინ-ტიუნები“. საზოგადოებრივი „ფაინ-ტიუნების“ ძლიერი შესრულება შესაძლოა აიხსნას მათი ბენჩმარკ-სპეციფიკური ადაპტაციებით, რაც იწვევს მოკლე გამომავალ შედეგებს და ენერგიის შემცირებულ მოხმარებას.
როდესაც ანალოგიურად ვამოწმებთ 7B+ მოდელებს, შეუსაბამო ტენდენციას ვაკვირდებით. Llama3.1-ისა და Qwen2.5-ისთვის, საბაზისო მოდელები ორჯერ მეტს მოიხმარენ, ვიდრე „ფაინ-ტიუნები“. Qwen2-ისა და Mistral v0.3-ისთვის, საზოგადოებრივი „ფაინ-ტიუნების“ მოხმარება უფრო მაღალია.
მნიშვნელოვანი განსხვავება საბაზისო მოდელსა და საზოგადოებრივ „ფაინ-ტიუნებს“ შორის Qwen2-72B-ში საინტერესო კითხვებს აჩენს ვერბოზულობის ან ტექსტის ხარისხის პოტენციურ განსხვავებებზე. საბაზისო მოდელს მნიშვნელოვნად მაღალი CO₂ ემისიები აქვს მის „ფაინ-ტიუნებთან“ შედარებით, მაშინ როცა საზოგადოებრივ „ფაინ-ტიუნებს“ გაცილებით დაბალი ემისიები აქვთ. ამ სამი მოდელის შედარება ჩვენი Comparator ინსტრუმენტის გამოყენებით შეგვიძლია: Qwen/Qwen2-72B (საბაზისო მოდელი), Qwen/Qwen2-72B-Instruct (ოფიციალური „ფაინ-ტიუნი), MaziyarPanahi/calme-2.1-qwen2-72b (საზოგადოებრივი „ფაინ-ტიუნი).
სამწუხაროდ, CO₂ დანახარჯები თითოეულ დავალებაზე ხელმისაწვდომი არ არის, ამიტომ გაურკვეველია, აქვთ თუ არა გარკვეულ ამოცანებს არაპროპორციულად დიდი გავლენა. თუმცა, ვიცით, რომ გენერაციული ამოცანები, როგორც წესი, უფრო ძვირია, რადგან ისინი მრავალარჩევანი ამოცანებისგან განსხვავებით, მეტი ტოკენის ინფერენციას საჭიროებს. ამის გათვალისწინებით, ჩვენ შევაფასეთ ამ სამი მოდელის გენერაციული შესაძლებლობები და შევადარეთ.
თეგები:
#ხელოვნური ინტელექტი
#llm
#ნახშირბადის კვალი
#ფაინ-ტიუნინგი
#გარემოსდაცვითი პასუხისმგებლობა
#ემისიები
#მწვანე ტექნოლოგიები
#მოდელის ინფერენცია
#open llm leaderboard
წყარო: huggingface.co
AI-ით გადამუშავებული