ტექსტის გენერაციისა და კონვერსაციული ტექნოლოგიები დიდი ხანია არსებობს. ამ ტექნოლოგიებთან მუშაობის ადრეული გამოწვევები იყო ტექსტის თანმიმდევრულობისა და მრავალფეროვნების კონტროლი დასკვნის პარამეტრებისა და დისკრიმინაციული მიკერძოების მეშვეობით. უფრო თანმიმდევრული გამომავალი ნაკლებად კრეატიული იყო, უფრო ახლოს თავდაპირველ სავარჯიშო მონაცემებთან და ნაკლებად ჰგავდა ადამიანის მიერ შექმნილს. ბოლოდროინდელმა განვითარებებმა გადალახა ეს გამოწვევები და მომხმარებლისთვის მოსახერხებელმა ინტერფეისებმა ყველას მისცა საშუალება, გამოეცადა ეს მოდელები. ChatGPT-ის მსგავსმა სერვისებმა ბოლო დროს ყურადღების ცენტრში მოაქცია მძლავრი მოდელები, როგორიცაა GPT-4, და გამოიწვია ღია წყაროების ალტერნატივების, როგორიცაა Llama, მასობრივი გავრცელება. ჩვენ ვფიქრობთ, რომ ეს ტექნოლოგიები დიდხანს იარსებებს და სულ უფრო მეტად ინტეგრირებული იქნება ყოველდღიურ პროდუქტებში. ეს პოსტი დაყოფილია შემდეგ სექციებად: ტექსტის გენერაციის მოდელები არსებითად გაწვრთნილია იმ მიზნით, რომ დაასრულონ არასრული ტექსტი ან შექმნან ტექსტი ნულიდან, მოცემულ ინსტრუქციაზე ან შეკითხვაზე პასუხად. მოდელებს, რომლებიც ავსებენ არასრულ ტექსტს, მიზეზობრივ ენობრივ მოდელებს (Causal Language Models) უწოდებენ, და ცნობილი მაგალითებია OpenAI-ის GPT-3 და Meta AI-ის Llama. სანამ წინ წავალთ, ერთი კონცეფცია, რომელიც უნდა იცოდეთ, არის „fine-tuning“ (დაზუსტება). ეს არის პროცესი, როდესაც ძალიან დიდ მოდელს ვიღებთ და ამ საბაზისო მოდელში არსებულ ცოდნას სხვა გამოყენების შემთხვევას, რომელსაც „ქვეამოცანას“ (downstream task) ვუწოდებთ, გადავცემთ. ეს ამოცანები შეიძლება იყოს ინსტრუქციების სახით. მოდელის ზომის ზრდასთან ერთად, მას შეუძლია უკეთესი განზოგადება მოახდინოს ინსტრუქციებზე, რომლებიც არ არსებობდა წინასწარი ვარჯიშის მონაცემებში, მაგრამ ნასწავლი იყო fine-tuning-ის დროს. მიზეზობრივი ენობრივი მოდელები ადაპტირდება ადამიანის უკუკავშირიდან გამაგრებითი სწავლის (reinforcement learning from human feedback - RLHF) პროცესის გამოყენებით. ეს ოპტიმიზაცია ძირითადად ხდება იმაზე, თუ რამდენად ბუნებრივად და თანმიმდევრულად ჟღერს ტექსტი და არა პასუხის მართებულობაზე. RLHF-ის მუშაობის ახსნა სცდება ამ ბლოგ-პოსტის ფარგლებს, მაგრამ ამ პროცესის შესახებ მეტი ინფორმაცია შეგიძლიათ იხილოთ აქ. მაგალითად, GPT-3 არის მიზეზობრივი ენობრივი საბაზისო მოდელი, ხოლო ChatGPT-ის ბექენდში არსებული მოდელები (რომელიც GPT-სერიის მოდელების ინტერფეისია) დაზუსტებულია RLHF-ის მეშვეობით მოთხოვნებზე, რომლებიც შეიძლება შედგებოდეს საუბრებისგან ან ინსტრუქციებისგან. მნიშვნელოვანია ამ მოდელებს შორის განსხვავების დანახვა. Hugging Face Hub-ზე შეგიძლიათ იპოვოთ როგორც მიზეზობრივი ენობრივი მოდელები, ასევე მიზეზობრივი ენობრივი მოდელები, რომლებიც ინსტრუქციებზე არიან დაზუსტებული (რაზეც ბმულებს ამ ბლოგ-პოსტში მოგვიანებით მოგაწვდით). Llama არის ერთ-ერთი პირველი ღია წყაროს LLM, რომელმაც აჯობა/გაუტოლდა დახურული წყაროს მოდელებს. Together-ის მიერ ხელმძღვანელებულმა კვლევითმა ჯგუფმა შექმნა Llama-ს მონაცემთა ნაკრების რეპროდუქცია, სახელწოდებით Red Pajama, და მასზე გაწვრთნა LLM-ები და ინსტრუქციებზე დაზუსტებული მოდელები. მეტი შეგიძლიათ წაიკითხოთ აქ და იპოვოთ მოდელის კონტროლის წერტილები (checkpoints) Hugging Face Hub-ზე. ამ ბლოგ-პოსტის დაწერის დროისთვის, სამი უმსხვილესი მიზეზობრივი ენობრივი მოდელი ღია წყაროს ლიცენზიებით არის MosaicML-ის MPT-30B, Salesforce-ის XGen და TII UAE-ის Falcon, რომლებიც სრულად ღიაა Hugging Face Hub-ზე. ცოტა ხნის წინ, Meta-მ გამოუშვა Llama 2, ღია წვდომის მოდელი ლიცენზიით, რომელიც კომერციულ გამოყენებას უშვებს. ამ დროისთვის, Llama 2 სხვა ღია წყაროს დიდ ენობრივ მოდელებს ყველა ბენჩმარკზე აღემატება. Llama 2-ის კონტროლის წერტილები Hugging Face Hub-ზე თავსებადია ტრანსფორმატორებთან (transformers), ხოლო უმსხვილესი კონტროლის წერტილი ყველასთვის ხელმისაწვდომია HuggingChat-ზე გამოსაცდელად. ამ ბლოგ-პოსტში შეგიძლიათ წაიკითხოთ მეტი, თუ როგორ უნდა მოახდინოთ Llama 2-ის დაზუსტება, განთავსება და მოთხოვნა. ტექსტის გენერაციის მოდელის მეორე ტიპს, როგორც წესი, text-to-text გენერაციის მოდელს უწოდებენ. ეს მოდელები გაწვრთნილია ტექსტური წყვილებზე, რომლებიც შეიძლება იყოს კითხვები და პასუხები ან ინსტრუქციები და რეაგირებები. ყველაზე პოპულარულია T5 და BART (რომლებიც ამჟამად არ არიან „state-of-the-art“). Google-მა ცოტა ხნის წინ გამოუშვა FLAN-T5 მოდელების სერია. FLAN არის ინსტრუქციების დაზუსტებისთვის შემუშავებული უახლესი ტექნიკა, ხოლო FLAN-T5 არსებითად T5-ია, რომელიც FLAN-ის გამოყენებით არის დაზუსტებული. ამჟამად, FLAN-T5 მოდელების სერია არის „state-of-the-art“ და ღია წყაროსი, ხელმისაწვდომი Hugging Face Hub-ზე. გაითვალისწინეთ, რომ ესენი განსხვავდება ინსტრუქციებზე დაზუსტებული მიზეზობრივი ენობრივი მოდელებისგან, თუმცა შეყვანა-გამოყვანის ფორმატი შეიძლება მსგავსი ჩანდეს. ქვემოთ შეგიძლიათ იხილოთ, თუ როგორ მუშაობს ეს მოდელები. ღია წყაროს ტექსტის გენერაციის მოდელების მეტი მრავალფეროვნება კომპანიებს საშუალებას აძლევს, შეინარჩუნონ მონაცემთა კონფიდენციალურობა, უფრო სწრაფად მოარგონ მოდელები თავიანთ დომენებს და შეამცირონ ხარჯები დასკვნისთვის, ნაცვლად დახურულ ფასიან API-ებზე დამოკიდებულებისა. Hugging Face Hub-ზე არსებული ყველა ღია წყაროს მიზეზობრივი ენობრივი მოდელი შეგიძლიათ იხილოთ აქ, ხოლო text-to-text გენერაციის მოდელები - აქ. Hugging Face-მა თანა-ხელმძღვანელობდა ორ სამეცნიერო ინიციატივას, BigScience-სა და BigCode-ს. მათი შედეგად შეიქმნა ორი დიდი ენობრივი მოდელი, BLOOM 🌸 და StarCoder 🌟. BLOOM არის მიზეზობრივი ენობრივი მოდელი, გაწვრთნილი 46 ენაზე და 13 პროგრამირების ენაზე. ეს არის პირველი ღია წყაროს მოდელი, რომელსაც GPT-3-ზე მეტი პარამეტრი აქვს. ყველა ხელმისაწვდომი კონტროლის წერტილი შეგიძლიათ იპოვოთ BLOOM-ის დოკუმენტაციაში. StarCoder არის ენობრივი მოდელი, გაწვრთნილი GitHub-დან ნებადართულ კოდზე (80-ზე მეტი პროგრამირების ენით 🤯) „Fill-in-the-Middle“ ამოცანით...