NLP მოდელების შედარებითი ანალიზი: RoBERTa, Mistral-7b და Llama-2-7b LoRA-ს გამოყენებით კატასტროფის ტვიტების კლასიფიკაციისთვის
ბუნებრივი ენის დამუშავების (NLP) სწრაფად განვითარებად სამყაროში, ენობრივი მოდელების შედარება გადამწყვეტია მათი ოპტიმალური გამოყენებისთვის კონკრეტულ ამოცანებში. ეს პოსტი ეძღვნება სამი მოდელის – RoBERTa, Mistral-7b და Llama-2-7b – შედარებას კატასტროფების შესახებ ტვიტების კლასიფიკაციის პრობლემაში. კვლევაში გამოყენებულია PEFT (Parameter-Efficient Fine-Tuning) ტექნიკის LoRA (Low-Rank Adaptation) მეთოდი, რომელიც მნიშვნელოვნად ამცირებს პარამეტრების რაოდენობას მოდელის წვრილად მორგებისას. განხილულია თითო
ბუნებრივი ენის დამუშავების (NLP) სწრაფად განვითარებად სამყაროში, ხშირად ვადარებთ სხვადასხვა ენობრივ მოდელს, რათა დავადგინოთ, რომელი მუშაობს საუკეთესოდ კონკრეტული ამოცანებისთვის. ეს ბლოგ პოსტი ეძღვნება სამი მოდელის შედარებას: RoBERTa, Mistral-7b და Llama-2-7b. ჩვენ გამოვიყენეთ ისინი საერთო პრობლემის გადასაჭრელად – კატასტროფების შესახებ ტვიტების კლასიფიკაციისთვის. მნიშვნელოვანია აღინიშნოს, რომ Mistral და Llama 2 არის დიდი მოდელები 7 მილიარდი პარამეტრით. საპირისპიროდ, RoBERTa-large (355M პარამეტრი) შედარებით პატარა მოდელია, რომელიც გამოყენებულია როგორც საბაზისო მოდელი შედარებითი კვლევისთვის.
ამ ბლოგში, ჩვენ გამოვიყენეთ PEFT (Parameter-Efficient Fine-Tuning) ტექნიკა: LoRA (Low-Rank Adaptation of Large Language Models) წინასწარ გაწვრთნილი მოდელის მიმდევრობის კლასიფიკაციის ამოცანაზე წვრილად მორგებისთვის. LoRA შექმნილია იმისთვის, რომ მნიშვნელოვნად შეამციროს ტრენირებადი პარამეტრების რაოდენობა, ძლიერი შესრულების შენარჩუნებით შემდგომ ამოცანებში. ამ ბლოგ პოსტის მთავარი მიზანია LoRA-ს წვრილად მორგების დანერგვა მიმდევრობის კლასიფიკაციის ამოცანებისთვის, Hugging Face-დან მიღებული სამი წინასწარ გაწვრთნილი მოდელის გამოყენებით: meta-llama/Llama-2-7b-hf, mistralai/Mistral-7B-v0.1 და roberta-large. შენიშვნა: მოხსენებული შედეგების რეპროდუცირებისთვის, გთხოვთ, შეამოწმოთ wandb ანგარიშებში დამაგრებული ვერსიები.
RoBERTa (Robustly Optimized BERT Approach) არის BERT მოდელის გაუმჯობესებული ვარიანტი, რომელიც შემოთავაზებულია Meta AI-ს კვლევითი გუნდის მიერ. BERT არის ტრანსფორმერზე დაფუძნებული ენობრივი მოდელი, რომელიც იყენებს თვით-ყურადღების მექანიზმებს სიტყვების კონტექსტუალური წარმოდგენებისთვის და გაწვრთნილია ნიღბიანი ენობრივი მოდელის ამოცანით. გაითვალისწინეთ, რომ BERT არის მხოლოდ ენკოდერის მოდელი, რომელიც გამოიყენება ბუნებრივი ენის გაგების ამოცანებისთვის (როგორიცაა მიმდევრობის კლასიფიკაცია და ტოკენების კლასიფიკაცია). RoBERTa არის პოპულარული მოდელი წვრილად მორგებისთვის და შესაფერისია, როგორც საბაზისო მოდელი ჩვენი ექსპერიმენტებისთვის. დამატებითი ინფორმაციისთვის შეგიძლიათ შეამოწმოთ Hugging Face-ის მოდელის ბარათი.
Llama 2 მოდელები, რაც ნიშნავს Large Language Model Meta AI-ს, მიეკუთვნება დიდი ენობრივი მოდელების (LLMs) ოჯახს, რომელიც Meta AI-მ შემოიღო. Llama 2 მოდელები განსხვავდებიან ზომით, პარამეტრების რაოდენობა მერყეობს 7 მილიარდიდან 65 მილიარდ ლარამდე. Llama 2 არის ავტო-რეგრესიული ენობრივი მოდელი, რომელიც დაფუძნებულია ტრანსფორმერის დეკოდერის არქიტექტურაზე. ტექსტის გენერირებისთვის, Llama 2 ამუშავებს სიტყვების მიმდევრობას, როგორც შეტანას და ინტერაციულად იწინასწარმეტყველებს შემდეგ ტოკენს მოძრავი ფანჯრის გამოყენებით.
Llama 2-ის არქიტექტურა ოდნავ განსხვავდება GPT-3-ის მსგავსი მოდელებისგან. მაგალითად, Llama 2 იყენებს SwiGLU აქტივაციის ფუნქციას ReLU-ს ნაცვლად და ირჩევს მბრუნავ პოზიციურ ჩანართებს აბსოლუტური სასწავლო პოზიციური ჩანართების ნაცვლად. ცოტა ხნის წინ გამოშვებულმა Llama 2-მა შემოიღო არქიტექტურული გაუმჯობესებები, რათა უკეთ გამოიყენოს ძალიან გრძელი მიმდევრობები კონტექსტის სიგრძის 4096 ტოკენამდე გაფართოებით და დაჯგუფებული მოთხოვნის ყურადღების (GQA) დეკოდირების გამოყენებით. Mistral 7B v0.1, 7.3 მილიარდი პარამეტრით, არის პირველი LLM, რომელიც Mistral AI-მ შემოიღო.
Mistral 7B-ის არქიტექტურაში გამოყენებული ძირითადი სიახლეებია: PEFT, Parameter Efficient Fine-Tuning, არის ტექნიკების (p-tuning, prefix-tuning, IA3, Adapters და LoRA) კრებული, რომელიც შექმნილია მსხვილი მოდელების წვრილად მორგებისთვის ბევრად მცირე საწვრთნელი პარამეტრების ნაკრების გამოყენებით, სრული წვრილად მორგებით მიღებული შესრულების დონის შენარჩუნებისას. LoRA, Low-Rank Adaptation, არის PEFT მეთოდი, რომელიც მსგავსია ადაპტერის ფენებთან. მისი მთავარი მიზანია მოდელის ტრენირებადი პარამეტრების შემცირება. LoRA-ს მოქმედება მოიცავს დაბალ რანგის განახლების მატრიცის სწავლას, წინასწარ გაწვრთნილი წონების გაყინულ მდგომარეობაში შენარჩუნებისას. RoBERTa-ს აქვს მაქსიმალური მიმდევრობის სიგრძის ლიმიტი 512, ამიტომ ჩვენ დავაყენეთ MAX_LEN=512 ყველა მოდელისთვის სამართლიანი შედარების უზრუნველსაყოფად.
მონაცემთა ნაკრებს ჩავტვირთავთ Hugging Face-დან: ახლა, დავყოთ მონაცემთა ნაკრები საწვრთნელ და ვალიდაციის ნაკრებებად. შემდეგ დავამატოთ სატესტო ნაკრები: აქ მოცემულია მონაცემთა ნაკრების მიმოხილვა: მოდით, შევამოწმოთ მონაცემთა განაწილება: სამიზნე განაწილება საწვრთნელ მონაცემთა ნაკრებში. ვინაიდან კლასები არ არის დაბალანსებული, გამოვთვლით დადებით და უარყოფით წონებს და გამოვიყენებთ მათ მოგვიანებით დანაკარგის გაანგარიშებისთვის: საბოლოო წონებია: შემდეგ, გამოვთვლით სვეტის ტექსტის მაქსიმალურ სიგრძეს: მოდით, შევხედოთ საწვრთნელი მონაცემების ერთი რიგის მაგალითს:
მონაცემები მოიცავს საკვანძო სიტყვას, მდებარეობას და ტვიტის ტექსტს. სიმარტივისთვის, ჩვენ ვირჩევთ ტექსტის მახასიათებელს, როგორც LLM-ის ერთადერთ შეტანას. ამ ეტაპზე, ჩვენ მოვამზადეთ საწვრთნელი, ვალიდაციის და სატესტო ნაკრებები HuggingFace ფორმატში, როგორც ამას წინასწარ გაწვრთნილი LLM-ები მოელიან. შემდეგი ნაბიჯი არის ტოკენიზებული მონაცემთა ნაკრების განსაზღვრა წვრთნისთვის შესაბამისი ტოკენიზატორის გამოყენებით, რათა ტექსტის მახასიათებელი გარდაიქმნას ტოკენის ID-ების მიმდევრობისა და ყურადღების ნიღბების ორ ტენსორად. ვინაიდან თითოეულ მოდელს აქვს თავისი სპეციფიკური ტოკენიზატორი, ჩვენ დაგვჭირდება სამი სხვადასხვა მონაცემთა ნაკრების განსაზღვრა. ვიწყებთ RoBERTa მონაცემთა ჩამტვირთავის განსაზღვრით: შენიშვნა: RoBERTa ტოკენიზატორი გაწვრთნილია სივრცეების, როგორც ტოკენის ნაწილის, დასამუშავებლად. შედეგად, წინადადების პირველი სიტყვა კოდირდება განსხვავებულად, თუ მას არ უძღვის თეთრი სივრცე. იმის უზრუნველსაყოფად, რომ პირველი სიტყვა შეიცავს სივრცეს, ჩვენ დავაყენეთ add_prefix_space=True. ასევე, სამივე მოდელისთვის თანმიმდევრული წინასწარი დამუშავების შესანარჩუნებლად, პარამეტრი დავაყენეთ
თეგები:
#llm
#მონაცემთა მეცნიერება
#ბუნებრივი ენის დამუშავება
#hugging face
#nlp
#lora
#peft
#mistral-7b
#roberta
#llama-2-7b
#ტვიტების კლასიფიკაცია
#კატასტროფა
#მოდელის შედარება
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ხელოვნური ინტელექტი
Anthropic-ის Claude-ის აღზევება Apple App Store-ის რეიტინგებში პენტაგონთან მოლაპარაკებების ფონზე
ხელოვნური ინტელექტი
ტრამპის ადმინისტრაცია Anthropic-ს სანქციებს უწესებს ხელოვნური ინტელექტის გამოყენებაზე უარის გამო: ექსპერტი ინდუსტრიის უსაფრთხოების ხარვეზებზე საუბრობს
ხელოვნური ინტელექტი