საკუთარი მოდელის დახვეწა თუ LLM API-ის გამოყენება? საკუთარი მოდელის შექმნა სრულ კონტროლს განიჭებთ, მაგრამ მოითხოვს მონაცემთა შეგროვების, მომზადებისა და განლაგების (deployment) ექსპერტიზას. LLM API-ები გაცილებით მარტივი გამოსაყენებელია, მაგრამ გაიძულებთ თქვენი მონაცემები გაუგზავნოთ მესამე მხარეს და ქმნის ძვირადღირებულ დამოკიდებულებებს LLM პროვაიდერებზე. ეს ბლოგპოსტი აჩვენებს, თუ როგორ შეგიძლიათ დააკავშიროთ LLM-ების მოხერხებულობა მორგებული მოდელების კონტროლთან და ეფექტურობასთან. ინვესტორთა განწყობის იდენტიფიცირების შემთხვევის შესწავლაში, ჩვენ ვაჩვენებთ, თუ როგორ გამოვიყენოთ ღია კოდის LLM სინთეზური მონაცემების შესაქმნელად თქვენი მორგებული მოდელის რამდენიმე ნაბიჯში მოსამზადებლად. ჩვენი მიღებული, მორგებული RoBERTa მოდელი აანალიზებს ახალი ამბების დიდ კორპუსს დაახლოებით $2.7-ად, GPT-4-ის $3061-თან შედარებით; გამოყოფს დაახლოებით 0.12 კგ CO2-ს, GPT-4-ის დაახლოებით 735-დან 1100 კგ CO2-თან შედარებით; აქვს 0.13 წამის დაყოვნება, GPT-4-ის ხშირად რამდენიმე წამთან შედარებით; პარალელურად ინვესტორთა განწყობის იდენტიფიცირებაში GPT-4-ის მსგავს შედეგებს აჩვენებს (ორივე შემთხვევაში 94% სიზუსტე და 0.94 F1 მაკრო). ჩვენ გთავაზობთ მრავალჯერად ნოუთბუქებს, რომელთა გამოყენებაც შეგიძლიათ თქვენს კონკრეტულ შემთხვევებში. წარმოიდგინეთ, რომ თქვენი უფროსი გთხოვთ, შექმნათ განწყობის ანალიზის სისტემა თქვენი კომპანიისთვის. Hugging Face Hub-ზე ნახავთ 100,000-ზე მეტ მონაცემთა ნაკრებს, რომელთაგან დაახლოებით 450-ს აქვს სიტყვა „განწყობა“ (sentiment) სათაურში, რომელიც მოიცავს განწყობას Twitter-ზე, ლექსებში ან ებრაულ ენაზე. ეს შესანიშნავია, მაგრამ თუ, მაგალითად, ფინანსურ დაწესებულებაში მუშაობთ და გჭირდებათ თქვენს პორტფელში არსებული კონკრეტული ბრენდების მიმართ განწყობის თვალყურის დევნება, არცერთი ეს მონაცემთა ნაკრები არ იქნება გამოსადეგი თქვენი ამოცანისთვის. იმ მილიონობით ამოცანის გათვალისწინებით, რომელთა გადაჭრაც კომპანიებს შეუძლიათ მანქანური სწავლის მეშვეობით, ნაკლებად სავარაუდოა, რომ ვინმემ უკვე შეაგროვა და გამოაქვეყნა მონაცემები იმ კონკრეტული შემთხვევისთვის, რომლის გადაჭრასაც თქვენი კომპანია ცდილობს. ამოცანის სპეციფიკური მონაცემთა ნაკრებებისა და მოდელების ამ ნაკლებობის გამო, ბევრი ადამიანი მიმართავს ზოგადი დანიშნულების LLM-ებს. ეს მოდელები იმდენად დიდია და ზოგადი, რომ მათ შეუძლიათ ამოცანების უმეტესობის გადაჭრა შთამბეჭდავი სიზუსტით ყოველგვარი დამატებითი კონფიგურაციის გარეშე. მათი მარტივი გამოსაყენებელი API-ები გამორიცხავს დახვეწასა და განლაგებაში ექსპერტიზის საჭიროებას. მათი ძირითადი ნაკლოვანებებია ზომა და კონტროლი: ასობით მილიარდი ან ტრილიონი პარამეტრით, ეს მოდელები არაეფექტურია და მხოლოდ რამდენიმე კომპანიის მიერ კონტროლირებულ გამოთვლით კლასტერებზე მუშაობს. 2023 წელს ერთმა განვითარებამ ფუნდამენტურად შეცვალა მანქანური სწავლის ლანდშაფტი: LLM-ებმა დაიწყეს ადამიანის მონაცემთა ანოტატორებთან თანასწორობის მიღწევა. ახლა არსებობს უამრავი მტკიცებულება, რომელიც აჩვენებს, რომ საუკეთესო LLM-ები აჭარბებენ „crowd workers“-ებს და უტოლდებიან ექსპერტებს ხარისხიანი (სინთეზური) მონაცემების შექმნაში (მაგ. Zheng et al. 2023, Gilardi et al. 2023, He et al. 2023). ამ განვითარების მნიშვნელობის გადაჭარბება რთულია. მორგებული მოდელების შესაქმნელად მთავარი შემაფერხებელი ფაქტორი იყო ფული, დრო და ექსპერტიზა, რომელიც საჭირო იყო ადამიანური მუშაკების დასაქირავებლად და კოორდინაციისთვის მორგებული სასწავლო მონაცემების შესაქმნელად. იმის გამო, რომ LLM-ები იწყებენ ადამიანთან თანასწორობის მიღწევას, მაღალი ხარისხის ანოტაციის სამუშაო ახლა ხელმისაწვდომია API-ების საშუალებით; რეპროდუცირებადი ანოტაციის ინსტრუქციების გაგზავნა შესაძლებელია „პრომპტების“ სახით; და სინთეზური მონაცემები თითქმის მყისიერად ბრუნდება, ერთადერთი შემაფერხებელი ფაქტორი გამოთვლითი რესურსია (compute). 2024 წელს ეს მიდგომა კომერციულად სიცოცხლისუნარიანი გახდება და გაზრდის ღია კოდის ღირებულებას მცირე და მსხვილი ბიზნესისთვის. 2023 წლის უმეტესი ნაწილის განმავლობაში, LLM-ების კომერციული გამოყენება ანოტაციის სამუშაოებისთვის დაბლოკილი იყო LLM API პროვაიდერების შემზღუდავი ბიზნეს პირობების გამო. Mistral-ის Mixtral-8x7B-Instruct-v0.1-ის მსგავსი მოდელებით, LLM-ის ანოტაციის სამუშაო და სინთეზური მონაცემები ახლა ღია ხდება კომერციული გამოყენებისთვის. Mixtral მუშაობს GPT-3.5-ის მსგავსად, და მისი Apache 2.0 ლიცენზიის წყალობით, მისი სინთეზური მონაცემების გამომუშავება შეიძლება გამოყენებულ იქნას როგორც სასწავლო მონაცემები უფრო მცირე, სპეციალიზებული მოდელებისთვის („მოსწავლეები“) კომერციული გამოყენებისთვის. ეს ბლოგპოსტი გთავაზობთ მაგალითს, თუ როგორ მნიშვნელოვნად დააჩქარებს ეს თქვენი საკუთარი მორგებული მოდელების შექმნას, პარალელურად მკვეთრად შეამცირებს გრძელვადიან „inference“ ხარჯებს. წარმოიდგინეთ, რომ თქვენ ხართ დეველოპერი მსხვილ საინვესტიციო ფირმაში, რომლის ამოცანაა ეკონომიკური სიახლეების განწყობის მონიტორინგი თქვენს საინვესტიციო პორტფელში არსებული კომპანიების მიმართ. ბოლო დრომდე, თქვენ გქონდათ ორი ძირითადი ვარიანტი: თქვენ შეგეძლოთ საკუთარი მოდელის დახვეწა. ეს მოითხოვს ანოტაციის ინსტრუქციების დაწერას, ანოტაციის ინტერფეისის შექმნას, მუშაკების (crowd workers) დაქირავებას, ხარისხის უზრუნველყოფის ზომების დანერგვას დაბალი ხარისხის მონაცემებთან გამკლავებისთვის, ამ მონაცემებზე მოდელის დახვეწას და მის განლაგებას. ან შეგიძლიათ თქვენი მონაცემები ინსტრუქციებთან ერთად გაუგზავნოთ LLM API-ს. თქვენ მთლიანად გამოტოვებთ დახვეწას და განლაგებას, და მონაცემთა ანალიზის პროცესს ამცირებთ ინსტრუქციების (პრომპტების) დაწერამდე, რომლებსაც უგზავნით „LLM ანოტატორს“ API-ის უკან. ამ შემთხვევაში, LLM API არის თქვენი საბოლოო „inference“ გადაწყვეტა და თქვენ LLM-ის გამომუშავებას პირდაპირ იყენებთ თქვენი ანალიზისთვის. მიუხედავად იმისა, რომ მეორე ვარიანტი უფრო ძვირია „inference“ ეტაპზე და მოითხოვს მგრძნობიარე მონაცემების მესამე მხარეს გაგზავნას, მისი დაყენება მნიშვნელოვნად მარტივია ვიდრე პირველი ვარიანტისა და, შესაბამისად, ბევრი დეველოპერის მიერ გამოიყენება. 2024 წელს სინთეზური მონაცემები გვთავაზობს მესამე ვარიანტს: პირველი ვარიანტის ხარჯთეფექტურობის გაერთიანებას მეორე ვარიანტის გამოყენების სიმარტივესთან. მარტივად რომ ვთქვათ, შეგიძლიათ გამოიყენოთ LLM („მასწავლებელი“) მონაცემთა მცირე ნიმუშის ანოტირებისთვის...