კოსმოპედია: უპრეცედენტო სინთეზური მონაცემები დიდი ენობრივი მოდელებისთვის
სტატია განიხილავს დიდი ენობრივი მოდელების (LLM) წვრთნისთვის ძვირადღირებული ადამიანური ანოტაციებიდან სინთეზურ მონაცემთა ნაკრებებზე გადასვლას. მიუხედავად იმისა, რომ Microsoft-ის Phi მოდელებმა სინთეზური მონაცემების გამოყენებით შესანიშნავი შედეგები აჩვენეს, მათი შექმნის დეტალები გაუმჟღავნებელი დარჩა. ამ ხარვეზის აღმოსაფხვრელად, წარმოდგენილია კოსმოპედია – უმსხვილესი ღია სინთეზური მონაცემთა ნაკრები (30 მილიონზე მეტი ფაილი, 25 მილიარდი „ტოკენი“), რომელიც გენერირებულია Mixtral-8x7B-Instruct-v0.1-ის მიერ
ტრადიციულად, ზედამხედველობითი ფაინ-ტიუნინგისა და ინსტრუქციული ფაინ-ტიუნინგისთვის მონაცემთა ნაკრებების შექმნა მოითხოვდა ადამიანის ანოტატორების დაქირავების ძვირადღირებულ და შრომატევად პროცესს. ეს პრაქტიკა მოიცავდა მნიშვნელოვან რესურსებს, რაც ზღუდავდა ასეთი მონაცემთა ნაკრებების განვითარებას ამ სფეროს მხოლოდ რამდენიმე ძირითად მოთამაშეზე. თუმცა, ბოლო დროს სიტუაცია შეიცვალა. ჩვენ ვიხილეთ ასობით მაღალი ხარისხის სინთეზური ფაინ-ტიუნინგის მონაცემთა ნაკრები, რომლებიც ძირითადად GPT-3.5-ისა და GPT-4-ის გამოყენებით შეიქმნა. საზოგადოებამ ასევე მხარი დაუჭირა ამ განვითარებას მრავალი პუბლიკაციით, რომლებიც ხელმძღვანელობენ პროცესს სხვადასხვა დომენისთვის და ეხებიან მასთან დაკავშირებულ გამოწვევებს [1][2][3][4][5].
თუმცა, ეს არ არის კიდევ ერთი ბლოგ-პოსტი სინთეზური ინსტრუქციული ფაინ-ტიუნინგის მონაცემთა ნაკრებების გენერირებაზე, თემაზე, რომელსაც საზოგადოება უკვე ვრცლად იკვლევს. ჩვენ ყურადღებას ვამახვილებთ რამდენიმე ათასიდან მილიონობით ნიმუშამდე გაფართოებაზე, რომლებიც შეიძლება გამოყენებულ იქნას დიდი ენობრივი მოდელების (LLM) ნულიდან წინასწარი წვრთნისთვის. ეს წარმოადგენს უნიკალურ გამოწვევებს. Microsoft-მა წინ წასწია ეს სფერო Phi მოდელების სერიით [6][7][8], რომლებიც ძირითადად სინთეზურ მონაცემებზე იყო გაწვრთნილი. მათ აჯობეს უფრო დიდ მოდელებს, რომლებიც ბევრად უფრო დიდხანს ვებ-მონაცემთა ნაკრებებზე წვრთნიდნენ. Phi-2 გასულ თვეში 617 ათასზე მეტჯერ იქნა ჩამოტვირთული და Hugging Face-ის ჰაბზე ყველაზე მოწონებულ 20 მოდელს შორისაა. მიუხედავად იმისა, რომ Phi მოდელების ტექნიკური ანგარიშები, როგორიცაა ნაშრომი „Textbooks Are All You Need“ (სახელმძღვანელოები არის ყველაფერი, რაც გჭირდებათ), ნათელს ჰფენს მოდელების შესანიშნავ შესრულებასა და შექმნას, ისინი უგულებელყოფენ არსებით დეტალებს მათი სინთეზური სავარჯიშო მონაცემთა ნაკრებების კურაციის შესახებ. უფრო მეტიც, თავად მონაცემთა ნაკრებები არ არის გამოქვეყნებული. ეს დებატებს იწვევს როგორც ენთუზიასტებში, ასევე სკეპტიკოსებში. ზოგი აქებს მოდელების შესაძლებლობებს, ხოლო კრიტიკოსები ამტკიცებენ, რომ ისინი შესაძლოა უბრალოდ „ბენჩმარკებს“ გადაამეტებენ (overfitting); ზოგიერთი მათგანი სინთეზურ მონაცემებზე მოდელების წინასწარი წვრთნის მიდგომას „ნაგავი შემოდის, ნაგავი გადის“ (« garbage in, garbage out») უწოდებს. მიუხედავად ამისა, მონაცემების გენერირების პროცესზე სრული კონტროლის ქონისა და Phi მოდელების მაღალი ეფექტურობის გამეორების იდეა ინტრიგაა და ღირს შესწავლა. ეს არის კოსმოპედიას შემუშავების მოტივაცია, რომლის მიზანია Phi-1.5-ისთვის გამოყენებული სავარჯიშო მონაცემების გამეორება. ამ პოსტში ჩვენ ვუზიარებთ ჩვენს საწყის დასკვნებს და განვიხილავთ არსებული მონაცემთა ნაკრების გაუმჯჯობესების გეგმებს. ჩვენ ვუღრმავდებით მონაცემთა ნაკრების შექმნის მეთოდოლოგიას, დეტალურად განვიხილავთ „პრომპტების“ კურაციისა და ტექნიკური სტეკის მიდგომას. კოსმოპედია სრულად ღიაა: ჩვენ ვაქვეყნებთ ჩვენი სრულყოფილი „ფაიფლაინის“ კოდს, მონაცემთა ნაკრებს და მასზე გაწვრთნილ 1 მილიარდი პარამეტრის მოდელს, სახელწოდებით cosmo-1b. ეს საშუალებას აძლევს საზოგადოებას, გაიმეოროს შედეგები და ააგოს მათზე. Phi მონაცემთა ნაკრებების შექმნის შესახებ ინფორმაციის ნაკლებობის გარდა, კიდევ ერთი ნაკლი ის არის, რომ ისინი იყენებენ საკუთრებრივ (proprietary) მოდელებს მონაცემების გენერირებისთვის. ამ ხარვეზების აღმოსაფხვრელად, ჩვენ წარმოგიდგენთ კოსმოპედიას, სინთეზური სახელმძღვანელოების, ბლოგ-პოსტების, ისტორიების, პოსტებისა და WikiHow სტატიების მონაცემთა ნაკრებს, რომელიც გენერირებულია Mixtral-8x7B-Instruct-v0.1-ის მიერ. ის შეიცავს 30 მილიონზე მეტ ფაილს და 25 მილიარდ „ტოკენს“, რაც მას დღემდე ყველაზე დიდ ღია სინთეზურ მონაცემთა ნაკრებად აქცევს. გაითვალისწინეთ: თუ თქვენ ელოდებით ისტორიებს ასობით H100 GPU-ზე ფართომასშტაბიანი გენერაციის ამოცანების განლაგების შესახებ, სინამდვილეში კოსმოპედიისთვის დროის უმეტესი ნაწილი დეტალურ „პრომპტ-ინჟინერიაზე“ დაიხარჯა. სინთეზური მონაცემების გენერირება შეიძლება მარტივი ჩანდეს, მაგრამ მრავალფეროვნების შენარჩუნება, რაც ოპტიმალური მუშაობისთვის გადამწყვეტია, მნიშვნელოვნად რთულდება გაფართოებისას. ამიტომ, აუცილებელია მრავალფეროვანი „პრომპტების“ კურაცია, რომელიც მოიცავს თემების ფართო სპექტრს და მინიმუმამდე დაიყვანს დუბლირებულ შედეგებს, რადგან არ გვსურს გამოთვლითი რესურსების დახარჯვა მილიარდობით სახელმძღვანელოს გენერირებაზე, რათა შემდეგ მათი უმეტესობა გადავყაროთ მსგავსების გამო. სანამ ასობით GPU-ზე გენერაციას დავიწყებდით, ჩვენ დიდი დრო დავხარჯეთ „პრომპტების“ განმეორებით დამუშავებაზე HuggingChat-ის მსგავსი ხელსაწყოებით. ამ სექციაში განვიხილავთ კოსმოპედიისთვის 30 მილიონზე მეტი „პრომპტის“ შექმნის პროცესს, რომელიც მოიცავს ასობით თემას და აღწევს 1%-ზე ნაკლებ დუბლირებულ შინაარსს. კოსმოპედიის მიზანია მაღალი ხარისხის სინთეზური მონაცემების დიდი რაოდენობით გენერირება თემების ფართო გაშუქებით. Phi-1.5-ის ტექნიკური ანგარიშის თანახმად, ავტორებმა 20,000 თემა შეარჩიეს 20 მილიარდი „ტოკენის“ სინთეზური სახელმძღვანელოს შესაქმნელად, ხოლო მრავალფეროვნებისთვის იყენებდნენ ნიმუშებს ვებ-მონაცემთა ნაკრებებიდან, აღნიშნავდნენ: „ჩვენ გულდასმით შევარჩიეთ 20 ათასი თემა ამ ახალი სინთეზური მონაცემების გენერირებისთვის. ჩვენს გენერაციის „პრომპტებში“, მრავალფეროვნებისთვის ვიყენებთ ნიმუშებს ვებ-მონაცემთა ნაკრებებიდან.“ თუ ვივარაუდებთ ფაილის საშუალო სიგრძეს 1000 „ტოკენს“, ეს გულისხმობს დაახლოებით 20 მილიონი განსხვავებული „პრომპტის“ გამოყენებას. თუმცა, თემებისა და ვებ-ნიმუშების გაერთიანების მეთოდოლოგია მრავალფეროვნების გასაზრდელად გაურკვეველი რჩება. ჩვენ ვაერთიანებთ ორ მიდგომას კოსმოპედიას „პრომპტების“ შესაქმნელად: კურატორულ წყაროებზე და ვებ-მონაცემებზე დაყრდნობით. მონაცემების წყაროს, რომელსაც ვეყრდნობით, „საწყის მონაცემებს“ (seed data) ვუწოდებთ.
თეგები:
#ხელოვნური ინტელექტი
#llm
#მანქანური სწავლება
#ღია წყარო
#სინთეზური მონაცემები
#მონაცემთა ნაკრები
#კოსმოპედია
#phi მოდელები
#mixtral
#პრომპტ-ინჟინერია
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგიები
Honor Magic V6: უთხელესი დასაკეცი ტელეფონი? პირველი შთაბეჭდილებები
ტექნოლოგიები
Honor Magic V6: ყველაზე თხელი დასაკეცი სმარტფონი და მისი შთამბეჭდავი შესაძლებლობები
ტექნოლოგიები