მოდით, გადავხედოთ გასულ წელს ღია დიდი ენობრივი მოდელების (LLM) სამყაროში! ამ დოკუმენტის მოცულობის შესანარჩუნებლად, ჩვენ არ განვიხილავთ კოდის მოდელებს. პირველ რიგში, როგორ მიიღება დიდი ენობრივი მოდელი? (თუ უკვე იცით, შეგიძლიათ ეს სექცია სწრაფად გადაიკითხოთ!) მოდელის არქიტექტურა (მისი კოდი) აღწერს მის კონკრეტულ იმპლემენტაციასა და მათემატიკურ ფორმას: ის წარმოადგენს ყველა მისი პარამეტრის ჩამონათვალს, ასევე იმას, თუ როგორ ურთიერთქმედებენ ისინი შეტანილ მონაცემებთან. ამჟამად, ყველაზე მაღალი წარმადობის LLM-ები წარმოადგენენ „მხოლოდ დეკოდერის“ (decoder-only) ტრანსფორმერის არქიტექტურის ვარიაციებს (მეტი დეტალი ორიგინალურ ტრანსფორმერების ნაშრომში). სავარჯიშო მონაცემთა ნაკრები შეიცავს ყველა მაგალითსა და დოკუმენტს, რომლებზეც მოდელი ვარჯიშობს (ანუ სწავლობს პარამეტრებს), შესაბამისად, ისწავლება კონკრეტული შაბლონები. უმეტეს შემთხვევაში, ეს დოკუმენტები შეიცავს ტექსტს, იქნება ეს ბუნებრივ ენაზე (მაგ.: ფრანგული, ინგლისური, ჩინური), პროგრამირების ენაზე (მაგ.: Python, C) თუ ნებისმიერი სახის სტრუქტურირებული მონაცემები, რომლებიც შეიძლება გამოისახოს ტექსტის სახით (მაგ.: ცხრილები markdown-ში ან latex-ში, განტოლებები და ა.შ.). ტოკენიზატორი განსაზღვრავს, თუ როგორ გარდაიქმნება ტექსტი სავარჯიშო მონაცემთა ნაკრებიდან რიცხვებად (ვინაიდან მოდელი მათემატიკური ფუნქციაა და შესაბამისად, შეტანილ მონაცემებად რიცხვები სჭირდება). ტოკენიზაცია ხდება ტექსტის ქვე-ერთეულებად, ტოკენებად გარდაქმნით (რომლებიც შეიძლება იყოს სიტყვები, ქვე-სიტყვები ან სიმბოლოები, ტოკენიზაციის მეთოდების მიხედვით). ტოკენიზატორის ლექსიკის ზომა მიუთითებს, თუ რამდენი სხვადასხვა ტოკენი იცის მან, როგორც წესი, 32 ათასიდან 200 ათასამდე. მონაცემთა ნაკრების ზომა ხშირად იზომება მასში შემავალი ტოკენების რაოდენობით, მას შემდეგ, რაც ის დაიყოფა ამ ინდივიდუალური, „ატომისტური“ ერთეულების თანმიმდევრობად, და დღესდღეობით ეს რიცხვი რამდენიმე ასეული მილიარდი ტოკენიდან რამდენიმე ტრილიონ ტოკენამდე მერყეობს! შემდეგ სავარჯიშო ჰიპერპარამეტრები განსაზღვრავენ, თუ როგორ ვარჯიშობს მოდელი. რამდენად უნდა შეიცვალოს პარამეტრები თითოეული ახალი მაგალითის მოსარგებად? რამდენად სწრაფად უნდა განახლდეს მოდელი? ამ პარამეტრების არჩევის შემდეგ, საჭიროა მხოლოდ 1) დიდი გამოთვლითი სიმძლავრე მოდელის გასავარჯიშებლად და 2) კომპეტენტური (და კეთილგანწყობილი) ადამიანები ვარჯიშის პროცესის გასაშვებად და მონიტორინგისთვის. ვარჯიში თავისთავად მოიცავს არქიტექტურის ინსტანცირებას (მატრიცების შექმნას ვარჯიშისთვის გამოყენებულ აპარატურაზე) და სავარჯიშო ალგორითმის გაშვებას სავარჯიშო მონაცემთა ნაკრებზე ზემოთ ნახსენები ჰიპერპარამეტრებით. შედეგი არის მოდელის წონების ნაკრები. ეს არის მოდელის პარამეტრები სწავლის შემდეგ და ის, რასაც ადამიანების უმეტესობა გულისხმობს ღია წინასწარ გაწვრთნილ მოდელზე წვდომაზე საუბრისას. ეს წონები შემდეგ შეიძლება გამოყენებულ იქნას ინფერენციისთვის, ანუ ახალ შეტანილ მონაცემებზე პროგნოზირებისთვის, მაგალითად, ტექსტის გენერირებისთვის. წინასწარ გაწვრთნილი LLM-ები ასევე შეიძლება სპეციალიზირდეს ან ადაპტირდეს კონკრეტული ამოცანისთვის წინასწარი გაწვრთნის შემდეგ, განსაკუთრებით მაშინ, როდესაც წონები ღიად არის გამოქვეყნებული. ისინი შემდეგ გამოიყენება როგორც საწყისი წერტილი გამოყენების შემთხვევებისა და აპლიკაციებისთვის პროცესის მეშვეობით, რომელსაც ეწოდება ფაინ-ტიუნინგი (fine-tuning) ანუ დაზუსტება. ფაინ-ტიუნინგი გულისხმობს დამატებითი სავარჯიშო ნაბიჯების გამოყენებას მოდელზე განსხვავებულ – ხშირად უფრო სპეციალიზებულ და პატარა – მონაცემთა ნაკრებზე, რათა მისი ოპტიმიზაცია მოხდეს კონკრეტული აპლიკაციისთვის. მიუხედავად იმისა, რომ ამ ნაბიჯს აქვს ღირებულება საჭირო გამოთვლითი სიმძლავრის თვალსაზრისით, ის, როგორც წესი, ბევრად ნაკლებად ძვირია, ვიდრე მოდელის ნულიდან გაწვრთნა, როგორც ფინანსურად, ასევე გარემოსდაცვითად. ეს არის ერთ-ერთი მიზეზი, რის გამოც მაღალი ხარისხის ღია წყაროს წინასწარ გაწვრთნილი მოდელები ძალიან საინტერესოა, რადგან ისინი შეიძლება თავისუფლად იყოს გამოყენებული და განვითარებული საზოგადოების მიერ, მაშინაც კი, როდესაც პრაქტიკოსებს მხოლოდ შეზღუდული გამოთვლითი ბიუჯეტი აქვთ. რა ღია მოდელები იყო ხელმისაწვდომი საზოგადოებისთვის 2023 წლამდე? 2022 წლის დასაწყისამდე, მანქანური სწავლების ტენდენცია იყო ის, რომ რაც უფრო დიდი იყო მოდელი (ანუ რაც მეტი პარამეტრი ჰქონდა), მით უკეთესი იყო მისი წარმადობა. კერძოდ, ჩანდა, რომ მოდელები, რომლებიც გარკვეულ ზომის ზღურბლს სცდებოდნენ, მკვეთრად აუმჯობესებდნენ შესაძლებლობებს. ამ ორ კონცეფციას „გამოვლენილი შესაძლებლობები“ (emergent abilities) და „მასშტაბირების კანონები“ (scaling laws) ეწოდა. 2022 წელს გამოქვეყნებული წინასწარ გაწვრთნილი ღია წყაროს მოდელების ოჯახები უმეტესად ამ პარადიგმას მიჰყვებოდნენ. **BLOOM (BigScience Large Open-science Open-access Multilingual Language Model)** BLOOM არის მოდელების ოჯახი, რომელიც გამოუშვა BigScience-მა, კოლაბორაციულმა ინიციატივამ, რომელშიც შედიოდა 1000 მკვლევარი 60 ქვეყნიდან და 250 დაწესებულებიდან. მას კოორდინაციას უწევდა Hugging Face, ფრანგულ ორგანიზაციებთან GENCI და IDRIS თანამშრომლობით. ეს მოდელები იყენებენ მხოლოდ დეკოდერის ტრანსფორმერებს მცირე მოდიფიკაციებით (ჩანერგვის შემდგომი ნორმალიზაცია [^1] და ALiBi პოზიციური ჩანერგვის გამოყენება [^2]). ამ ოჯახის ყველაზე დიდი მოდელი არის 176 მილიარდი პარამეტრის მოდელი, რომელიც გაწვრთნილია 350 მილიარდ ტოკენზე, მრავალენოვანი მონაცემების გამოყენებით 46 ადამიანურ ენასა და 13 პროგრამირების ენაზე. სავარჯიშო მონაცემების უმეტესი ნაწილი გამოქვეყნდა, ასევე გამოქვეყნდა მისი წყაროების, კურაციის და დამუშავების დეტალები. ის დღემდე ყველაზე დიდი ღია წყაროს მრავალენოვანი მოდელია. **OPT (Open Pre-trained Transformer)** OPT მოდელების ოჯახი Meta-მ გამოუშვა. ეს მოდელები იყენებენ მხოლოდ დეკოდერის ტრანსფორმერების არქიტექტურას, GPT-3-ის ნაშრომში აღწერილი ხრიკების დაცვით (წონების სპეციფიკური ინიციალიზაცია, წინასწარი ნორმალიზაცია), ყურადღების მექანიზმში გარკვეული ცვლილებებით (მკვრივი და ლოკალურად ზოლიანი ყურადღების ფენების მონაცვლეობით). ამ ოჯახის ყველაზე დიდი მოდელი არის 175 მილიარდი პარამეტრის მოდელი, რომელიც გაწვრთნილია 180 მილიარდ ტოკენზე, ძირითადად საჯარო წყაროებიდან მიღებულ მონაცემებზე (წიგნები...