Hugging Face წარმოგიდგენთ TII-ის Falcon 180B-ს: ღია წყაროს მოდელების უახლესი მიღწევა
Hugging Face სიამაყით წარადგენს TII-ის Falcon 180B-ს – ღია წყაროს უდიდეს და უახლესი ტექნოლოგიების მწვერვალზე მდგომ ენობრივ მოდელს. 180 მილიარდი პარამეტრით და 3.5 ტრილიონ ტოკენზე გაწვრთნილი Falcon 180B ლიდერობს ღია წყაროს მოდელებს შორის და კონკურენციას უწევს ისეთ კომერციულ გიგანტებს, როგორიცაა Google-ის PaLM-2. მოდელი უკვე ხელმისაწვდომია Hugging Face Hub-ზე, რაც მაღალი შესაძლებლობის ხელოვნურ ინტელექტს ფართო საზოგადოებისთვის ხელმისაწვდომს ხდის.
დღეს, Hugging Face სიხარულით მიესალმება TII-ის Falcon 180B-ს! Falcon 180B ღია წყაროს მოდელების სფეროში ახალ სტანდარტს აწესებს. ეს არის ყველაზე დიდი ღიად ხელმისაწვდომი ენობრივი მოდელი, რომელიც 180 მილიარდი პარამეტრით გამოირჩევა და გაწვრთნილია 3.5 ტრილიონ ტოკენზე, TII-ის RefinedWeb მონაცემთა ნაკრების გამოყენებით. ეს წარმოადგენს ყველაზე ხანგრძლივ ერთეპოქიან წინასწარ წვრთნას ღია მოდელისთვის. მოდელის პოვნა შეგიძლიათ Hugging Face Hub-ზე (ბაზისური და ჩატის მოდელი) და მასთან ინტერაქცია შესაძლებელია Falcon Chat Demo Space-ზე.
შესაძლებლობების თვალსაზრისით, Falcon 180B აღწევს თანამედროვე ტექნოლოგიების მწვერვალს ბუნებრივი ენის დამუშავების ამოცანებში. ის ლიდერობდა (წინასწარ გაწვრთნილი) ღია წვდომის მოდელების ლიდერბორდზე (გამოშვების დროს) და კონკურენციას უწევს ისეთ საკუთრებრივ მოდელებს, როგორიცაა PaLM-2. მიუხედავად იმისა, რომ მისი საბოლოო რეიტინგი ჯერ კიდევ დასაზუსტებელია, ის PaLM-2 Large-ის დონის მოდელად ითვლება, რაც Falcon 180B-ს ერთ-ერთ ყველაზე მძლავრ საჯაროდ ცნობილ დიდ ენობრივ მოდელად (LLM) აქცევს.
ამ ბლოგპოსტში, ჩვენ განვიხილავთ, თუ რა ხდის Falcon 180B-ს ასეთ გამორჩეულს, ვაანალიზებთ შეფასების ზოგიერთ შედეგს და გაჩვენებთ, თუ როგორ შეგიძლიათ მოდელის გამოყენება. Falcon 180B არის TII-ის მიერ გამოშვებული მოდელი, რომელიც Falcon ოჯახის წინა ვერსიებს აგრძელებს. არქიტექტურული თვალსაზრისით, Falcon 180B წარმოადგენს Falcon 40B-ის გაფართოებულ ვერსიას და ეფუძნება მის ინოვაციებს, როგორიცაა მულტიქუერი ყურადღების მექანიზმი გაუმჯობესებული მასშტაბურობისთვის. არქიტექტურის დეტალურად გასაცნობად, გირჩევთ გაეცნოთ Falcon-ის წარმდგენ საწყის ბლოგპოსტს.
Falcon 180B გაწვრთნილია 3.5 ტრილიონ ტოკენზე ერთდროულად 4096-მდე GPU-ს გამოყენებით, Amazon SageMaker-ის მეშვეობით, რაც ჯამში დაახლოებით 7,000,000 GPU საათს შეადგენს. ეს ნიშნავს, რომ Falcon 180B 2.5-ჯერ დიდია, ვიდრე Llama 2 და გაწვრთნილია 4-ჯერ მეტი გამოთვლითი რესურსით. Falcon 180B-ის მონაცემთა ნაკრები უმეტესად შედგება RefinedWeb-ის ვებ მონაცემებისგან (~85%). გარდა ამისა, ის გაწვრთნილია კურირებული მონაცემების ნარევზე, როგორიცაა საუბრები, ტექნიკური დოკუმენტები და კოდის მცირე ნაწილი (~3%). წინასწარი წვრთნის ეს მონაცემთა ნაკრები იმდენად დიდია, რომ 3.5 ტრილიონი ტოკენიც კი ერთ ეპოქაზე ნაკლებს შეადგენს. გამოშვებული ჩატის მოდელი დაზუსტებით გაწვრთნილია ჩატისა და ინსტრუქციების მონაცემთა ნაკრებებზე, რამდენიმე მასშტაბური სასაუბრო მონაცემთა ნაკრების ნარევით.
‼️ კომერციული გამოყენება: Falcon 180B შეიძლება გამოყენებულ იქნას კომერციული მიზნებისთვის, თუმცა ძალიან შემზღუდავი პირობებით, რაც გამორიცხავს "ჰოსტინგისთვის გამოყენებას". გირჩევთ, გაეცნოთ ლიცენზიას და კონსულტაცია გაიაროთ თქვენს იურიდიულ გუნდთან, თუ დაინტერესებული ხართ მისი კომერციული მიზნებისთვის გამოყენებით.
Falcon 180B იყო საუკეთესო ღიად გამოშვებული LLM მისი გამოშვების დროს, აჯობა Llama 2 70B-ს და OpenAI-ის GPT-3.5-ს MMLU-ზე, და უტოლდება Google-ის PaLM 2-Large-ს ისეთ ბენჩმარკებზე, როგორიცაა HellaSwag, LAMBADA, WebQuestions, Winogrande, PIQA, ARC, BoolQ, CB, COPA, RTE, WiC, WSC, ReCoRD. Falcon 180B, როგორც წესი, GPT 3.5-სა და GPT-4-ს შორის პოზიციონირებს, რაც დამოკიდებულია შეფასების ბენჩმარკზე, და საზოგადოების მხრიდან შემდგომი დაზუსტება (finetuning) მისი ღიად გამოშვების შემდეგ, ძალიან საინტერესო იქნება. გამოშვების დროს 68.74 ქულით Hugging Face-ის ლიდერბორდზე, Falcon 180B იყო ყველაზე მაღალი ქულის მქონე ღიად გამოშვებული წინასწარ გაწვრთნილი LLM, რომელმაც აჯობა Meta-ს Llama 2-ს.
კვანტიზებული Falcon მოდელები ინარჩუნებენ მსგავს მეტრიკებს სხვადასხვა ბენჩმარკზე. შედეგები ანალოგიური იყო torch.float16, 8bit და 4bit ვერსიების შეფასებისას. შედეგების სანახავად იხილეთ ღია LLM ლიდერბორდი. Falcon 180B ხელმისაწვდომია Hugging Face ეკოსისტემაში, Transformers-ის 4.33 ვერსიიდან მოყოლებული. შეგიძლიათ მარტივად სცადოთ დიდი Falcon მოდელი (180 მილიარდი პარამეტრი!) ამ Space-ში ან ქვემოთ ჩაშენებულ სათამაშო მოედანზე:
ჩვენ ჩავატარეთ რამდენიმე ტესტი აპარატურულ მოთხოვნებზე, რომლებიც საჭიროა მოდელის გასაშვებად სხვადასხვა გამოყენების შემთხვევაში. ეს არ არის მინიმალური მოთხოვნები ზოგადად, არამედ მინიმალური მოთხოვნები იმ კონფიგურაციებისთვის, რომლებზეც ჩვენ გვქონდა წვდომა. ბაზისურ მოდელს არ აქვს პრომპტის ფორმატი. გახსოვდეთ, რომ ეს არ არის სასაუბრო მოდელი და არ არის გაწვრთნილი ინსტრუქციებზე, ამიტომ არ მოელით მისგან სასაუბრო პასუხების გენერირებას – წინასწარ გაწვრთნილი მოდელი შესანიშნავი პლატფორმაა შემდგომი დაზუსტებისთვის, მაგრამ სავარაუდოდ, არ უნდა გამოიყენოთ ის პირდაპირ "ყუთიდან ამოღებისთანავე". ჩატის მოდელს აქვს ძალიან მარტივი სასაუბრო სტრუქტურა. Transformers 4.33-ის გამოშვებით, შეგიძლიათ გამოიყენოთ Falcon 180B და ისარგებლოთ HF ეკოსისტემის ყველა ხელსაწყოთი, როგორიცაა:
მოდელის გამოყენება მოითხოვს მისი ლიცენზიისა და გამოყენების პირობების მიღებას. გთხოვთ, დარწმუნდით, რომ შესული ხართ თქვენს Hugging Face ანგარიშში და გაქვთ Transformers-ის უახლესი ვერსია. ასე გამოიყენებდით ბაზისურ მოდელს bfloat16-ში. Falcon 180B დიდი მოდელია, ამიტომ გთხოვთ, გაითვალისწინოთ ზემოთ მოცემულ ცხრილში შეჯამებული აპარატურული მოთხოვნები. ამან შეიძლება გამოიწვიოს ისეთი გამომავალი შედეგი, როგორიცაა:
Falcon 180B-ის 8-ბიტიანი და 4-ბიტიანი კვანტიზებული ვერსიები შეფასებისას თითქმის არ აჩვენებს განსხვავებას bfloat16 საცნობარო ვერსიასთან შედარებით! ეს ძალიან კარგი ამბავია ინფერენსისთვის, რადგან შეგიძლიათ დამაჯერებლად გამოიყენოთ კვანტიზებული ვერსია აპარატურული მოთხოვნების შესამცირებლად. თუმცა, გაითვალისწინეთ, რომ 8-ბიტიანი ინფერენსი გაცილებით სწრაფია, ვიდრე მოდელის 4-ბიტიან რეჟიმში გაშვება. კვანტიზაციის გამოსაყენებლად, უნდა დააინსტალიროთ bitsandbytes ბიბლიოთეკა და უბრალოდ გააქტიუროთ შესაბამისი დროშა მოდელის ჩატვირთვისას: როგორც ზემოთ აღინიშნა, მოდელის ვერსია, რომელიც საუბრების მიდევნებისთვის იყო დაზუსტებული, იყენებდა ძალიან მარტივ წვრთნის შაბლონს. ჩვენ უნდა მივყვეთ იმავე ნიმუშს...
თეგები:
#ხელოვნური ინტელექტი
#llm
#მანქანური სწავლება
#დიდი ენობრივი მოდელი
#ღია წყარო
#გენერაციული ai
#huggingface
#tii
#falcon 180b
წყარო: huggingface.co
AI-ით გადამუშავებული