სინთეზური მონაცემები არის ხელოვნურად გენერირებული ინფორმაცია, რომელიც რეალური სამყაროს მონაცემებს ბაძავს. ის შესაძლებლობას იძლევა, დაძლიოს მონაცემთა შეზღუდვები მონაცემთა ნაკრებების გაფართოებით ან გაუმჯობესებით. სინთეზური მონაცემების გენერატორი იღებს თქვენთვის სასურველი მონაცემების აღწერას (თქვენს მიერ შექმნილ მოთხოვნას/პრომპტს) და სინთეზური მონაცემების პაიპლაინის გამოყენებით აბრუნებს მონაცემთა ნაკრებს თქვენი კონკრეტული ამოცანისთვის. ფონურ რეჟიმში, ეს სისტემა დაფუძნებულია distilabel-სა და Hugging Face-ის უფასო ტექსტის გენერაციის API-ზე, თუმცა ამ სირთულეებზე ფიქრი არ გვჭირდება და შეგვიძლია ფოკუსირება მომხმარებლის ინტერფეისის (UI) გამოყენებაზე. ინსტრუმენტი ამჟამად მხარს უჭერს ტექსტის კლასიფიკაციისა და ჩატის მონაცემთა ნაკრებებს. ეს ამოცანები განსაზღვრავს გენერირებული მონაცემთა ნაკრების ტიპს: კლასიფიკაცია მოითხოვს კატეგორიებს, ხოლო ჩატის მონაცემები - საუბარს. მოთხოვნის მიხედვით, დროთა განმავლობაში დავამატებთ ისეთ ამოცანებს, როგორიცაა შეფასება (evaluation) და RAG (Retrieval-Augmented Generation). ტექსტის კლასიფიკაცია გავრცელებულია ტექსტების კატეგორიზაციისთვის, როგორიცაა მომხმარებლის შეფასებები, სოციალური მედიის პოსტები ან საინფორმაციო სტატიები. კლასიფიკაციის მონაცემთა ნაკრების გენერირება ეფუძნება ორ განსხვავებულ ნაბიჯს, რომლებსაც დიდი ენობრივი მოდელების (LLMs) დახმარებით ვასრულებთ. ჯერ ვქმნით მრავალფეროვან ტექსტებს, შემდეგ კი ვამატებთ მათ იარლიყებს. სინთეზური ტექსტის კლასიფიკაციის მონაცემთა ნაკრების კარგი მაგალითია argilla/synthetic-text-classification-news, რომელიც სინთეზურ საინფორმაციო სტატიებს 8 სხვადასხვა კლასად ყოფს. ამ ტიპის მონაცემთა ნაკრები შეიძლება გამოყენებულ იქნას კონტროლირებადი დაზუსტებისთვის (SFT), რაც არის ტექნიკა, რომელიც LLM-ებს საშუალებას აძლევს იმუშაონ სალაპარაკო მონაცემებთან, რაც მომხმარებელს LLM-ებთან ჩატის ინტერფეისის მეშვეობით ურთიერთობის საშუალებას აძლევს. სინთეზური ჩატის მონაცემთა ნაკრების კარგი მაგალითია argilla/synthetic-sft-customer-support-single-turn, რომელიც გვიჩვენებს მომხმარებელთა მხარდაჭერისთვის შექმნილი LLM-ის მაგალითს. ამ კონკრეტულ მაგალითში, მომხმარებელთა მხარდაჭერის თემა თავად სინთეზური მონაცემების გენერატორია. ზოგადად, წუთში შეგვიძლია 50 ნიმუშის გენერირება ტექსტის კლასიფიკაციისთვის და 20 ნიმუშის ჩატისთვის. ეს ყველაფერი Hugging Face-ის უფასო API-ით არის უზრუნველყოფილი, თუმცა თქვენ შეგიძლიათ გაზარდოთ მასშტაბი საკუთარი ანგარიშის გამოყენებით და პერსონალური მოდელების, API პროვაიდერების ან გენერაციის კონფიგურაციების არჩევით. ამ საკითხს მოგვიანებით დავუბრუნდებით, ახლა კი საფუძვლებს ჩავუღრმავდეთ. ჩვენ შევქმნით ძირითად ჩატის მონაცემთა ნაკრებს. გენერატორთან ვიზიტისას, აუცილებელია სისტემაში შესვლა, რათა ინსტრუმენტს მიეცეს წვდომა იმ ორგანიზაციებზე, რომლებისთვისაც გსურთ მონაცემთა ნაკრებების გენერირება. ეს ინსტრუმენტს საშუალებას მისცემს, ატვირთოს გენერირებული მონაცემთა ნაკრებები. ავთენტიფიკაციის წარუმატებლობის შემთხვევაში, ყოველთვის შეგიძლიათ კავშირის გადატვირთვა. სისტემაში შესვლის შემდეგ, მომხმარებლის ინტერფეისი (UI) სამსაფეხურიან მარტივ პროცესში გაგიძღვებათ: დაიწყეთ იმ მონაცემთა ნაკრების აღწერით, რომლის შექმნაც გსურთ, მათ შორის გამოყენების მაგალითების მითითებით, რათა გენერატორმა უკეთ გაიგოს თქვენი საჭიროებები. დარწმუნდით, რომ რაც შეიძლება დეტალურად აღწერთ ასისტენტის მიზანსა და ტიპს. ღილაკზე „Create“ (შექმნა) დაჭერისას შეიქმნება ნიმუშის მონაცემთა ნაკრები და შეგიძლიათ გააგრძელოთ მე-2 ნაბიჯით. დახვეწეთ თქვენი გენერირებული ნიმუშის მონაცემთა ნაკრები სისტემის მოთხოვნის (system prompt) კორექტირებით, რომელიც თქვენი აღწერის საფუძველზე შეიქმნა, და დავალების სპეციფიკური პარამეტრების მორგებით. ეს დაგეხმარებათ მიიღოთ კონკრეტული შედეგები, რომლებსაც ეძებთ. შეგიძლიათ ამ კონფიგურაციების განმეორებითი რეგულირება ღილაკზე „Save“ (შენახვა) დაჭერით და თქვენი ნიმუშის მონაცემთა ნაკრების ხელახალი გენერირებით. როდესაც კონფიგურაციით კმაყოფილი იქნებით, გააგრძელეთ მე-3 ნაბიჯით. შეავსეთ ზოგადი ინფორმაცია მონაცემთა ნაკრების სახელისა და ორგანიზაციის შესახებ. გარდა ამისა, შეგიძლიათ განსაზღვროთ გენერირებული ნიმუშების რაოდენობა და გენერაციისთვის გამოსაყენებელი ტემპერატურა. ეს ტემპერატურა გენერირებული შედეგების კრეატიულობას წარმოადგენს. დავაჭიროთ ღილაკს „Generate“ (გენერირება) სრული გენერაციის დასაწყებად. გამომავალი მონაცემები პირდაპირ შეინახება Argilla-სა და Hugging Face Hub-ში. ახლა შეგვიძლია დავაჭიროთ ღილაკს „Open in Argilla“ (გახსნა Argilla-ში) და პირდაპირ გადავიდეთ ჩვენს გენერირებულ მონაცემთა ნაკრებზე. სინთეზურ მონაცემებთან მუშაობის დროსაც კი მნიშვნელოვანია მონაცემების გაგება და ანალიზი, რის გამოც შევქმენით პირდაპირი ინტეგრაცია Argilla-სთან - ხელოვნური ინტელექტის ინჟინრებისა და სფეროს ექსპერტებისთვის განკუთვნილი თანამშრომლობის ინსტრუმენტი მაღალი ხარისხის მონაცემთა ნაკრებების შესაქმნელად. ეს საშუალებას გაძლევთ ეფექტურად გამოიკვლიოთ და შეაფასოთ სინთეზური მონაცემთა ნაკრები ისეთი მძლავრი ფუნქციების მეშვეობით, როგორიცაა სემანტიკური ძიება და კომპოზიტური ფილტრები. მეტი შეგიძლიათ გაიგოთ ამ სახელმძღვანელოში. ამის შემდეგ, შეგვიძლია ექსპორტი გავაკეთოთ დამუშავებული მონაცემთა ნაკრების Hugging Face Hub-ში და გავაგრძელოთ მოდელის დაზუსტება (fine-tuning) მისი გამოყენებით. არ ინერვიულოთ; ძლიერი AI მოდელების შექმნაც კი დღესდღეობით კოდის გარეშეა შესაძლებელი AutoTrain-ის გამოყენებით. AutoTrain-ის გასაგებად, შეგიძლიათ იხილოთ მისი დოკუმენტაცია. აქ, ჩვენ შევქმნით AutoTrain-ის საკუთარ განთავსებას (deployment) და შევალთ სისტემაში, როგორც ეს ადრე გავაკეთეთ სინთეზური მონაცემების გენერატორისთვის. გახსოვთ argilla/synthetic-text-classification-news მონაცემთა ნაკრები დასაწყისიდან? მოდით, გავწვრთნათ მოდელი, რომელსაც შეუძლია სწორად მოახდინოს ამ მაგალითების კლასიფიკაცია. ჩვენ უნდა ავირჩიოთ ამოცანა „Text Classification“ (ტექსტის კლასიფიკაცია) და მივუთითოთ სწორი „Dataset source“ (მონაცემთა ნაკრების წყარო). შემდეგ, ავირჩიოთ კარგი პროექტის სახელი და დავაჭიროთ „play“-ს! ამომხტარი ფანჯარა, რომელიც ხარჯების შესახებ გვაფრთხილებს, შეიძლება უგულებელვყოთ, რადგან ჩვენ ჯერ კიდევ Hugging Face-ის უფასო CPU აპარატურაზე ვმუშაობთ, რაც სრულიად საკმარისია ამ ტექსტის კლასიფიკაციის მაგალითისთვის. და აი, რამდენიმე წუთის შემდეგ, ჩვენ უკვე გვაქვს ჩვენი საკუთარი მოდელი! რჩება მხოლოდ მისი განთავსება.