Meta-ს Llama 3, ღია წვდომის Llama ოჯახის შემდეგი თაობა, უკვე გამოვიდა და ხელმისაწვდომია Hugging Face-ზე. სასიხარულოა, რომ Meta აგრძელებს ღია ხელოვნური ინტელექტისადმი ერთგულებას და ჩვენ მოხარულნი ვართ სრულად დავუჭიროთ მხარი ამ გაშვებას Hugging Face-ის ეკოსისტემაში ყოვლისმომცველი ინტეგრაციით. Llama 3 ხელმისაწვდომია ორი ზომის: 8B ვერსია განკუთვნილია ეფექტური განლაგებისა და განვითარებისთვის სამომხმარებლო ზომის GPU-ებზე, ხოლო 70B ვერსია - ფართომასშტაბიანი ხელოვნური ინტელექტის (AI) მშობლიური აპლიკაციებისთვის. ორივე ზომა წარმოდგენილია როგორც საბაზისო, ისე ინსტრუქციებზე მორგებულ ვარიანტებში. ოთხივე მოდელის გარდა, Llama Guard-ის ახალი ვერსია, Llama 3 8B-ზე დაფუძნებული, დაიხვეწა და გამოვიდა Llama Guard 2-ის სახელით (უსაფრთხოებისათვის დახვეწილი ვერსია). ჩვენ ვითანამშრომლეთ Meta-სთან, რათა უზრუნველგვეყო საუკეთესო ინტეგრაცია Hugging Face-ის ეკოსისტემაში. ხუთივე ღია წვდომის მოდელი (2 საბაზისო, 2 დახვეწილი და Llama Guard) ხელმისაწვდომია Hub-ზე. გამოშვებულ ფუნქციებსა და ინტეგრაციებს შორის არის: Llama 3-ის გამოშვება წარმოგიდგენთ Meta-ს ოთხ ახალ, ღია LLM მოდელს, რომლებიც Llama 2-ის არქიტექტურაზეა დაფუძნებული. ისინი ხელმისაწვდომია ორი ზომის: 8B და 70B პარამეტრების, თითოეული საბაზისო (წინასწარ გაწვრთნილი) და ინსტრუქციებზე მორგებული ვერსიებით. ყველა ვარიანტის გაშვება შესაძლებელია სხვადასხვა ტიპის სამომხმარებლო აპარატურაზე და აქვს 8K ტოკენის კონტექსტის სიგრძე. ამ ოთხი საბაზისო მოდელის გარდა, გამოვიდა Llama Guard 2-იც. Llama 3 8B-ზე დახვეწილი, ის Llama Guard ოჯახის უახლესი ვერსიაა. Llama Guard 2, შექმნილი საწარმოო გამოყენებისთვის, მიზნად ისახავს LLM შეტანის (prompts) და LLM პასუხების კლასიფიკაციას, რათა აღმოაჩინოს ისეთი შინაარსი, რომელიც რისკების ტაქსონომიაში სახიფათოდ ჩაითვლება. Llama 3-ის მნიშვნელოვანი ცვლილება Llama 2-თან შედარებით არის ახალი ტოკენაიზერის გამოყენება, რომელიც აფართოებს ლექსიკონის ზომას 128,256-მდე (წინა ვერსიის 32K ტოკენის ნაცვლად). ეს უფრო დიდი ლექსიკონი ტექსტის უფრო ეფექტურად კოდირების საშუალებას იძლევა (როგორც შეტანისთვის, ასევე გამოსატანად) და პოტენციურად აძლიერებს მრავალენოვნებას. თუმცა, ამას თავისი ფასი აქვს: ჩაშენების (embedding) შეტანის და გამომავალი მატრიცები უფრო დიდია, რაც მცირე მოდელის პარამეტრების რაოდენობის ზრდის დიდ ნაწილს შეადგენს: Llama 2-ის 7B-დან Llama 3-ის 8B-მდე. გარდა ამისა, მოდელის 8B ვერსია ახლა იყენებს ჯგუფურ-კითხვით ყურადღებას (Grouped-Query Attention - GQA), რაც ეფექტური წარმოდგენაა და უნდა დაეხმაროს უფრო ხანგრძლივ კონტექსტებთან მუშაობაში. Llama 3 მოდელები გაწვრთნილია დაახლოებით 8-ჯერ მეტ მონაცემზე, 15 ტრილიონზე მეტ ტოკენზე, საჯაროდ ხელმისაწვდომი ონლაინ მონაცემების ახალი ნაზავით ორ კლასტერზე, სადაც 24,000 GPU იყო გამოყენებული. ჩვენ არ ვიცით ტრენინგის მონაცემთა ზუსტი დეტალები, და მხოლოდ შეგვიძლია ვივარაუდოთ, რომ მონაცემების უფრო დიდი და გულმოდგინე კურატორია იყო გაუმჯობესებული შესრულების მთავარი ფაქტორი. Llama 3 Instruct ოპტიმიზირებულია დიალოგური აპლიკაციებისთვის და გაწვრთნილია 10 მილიონზე მეტ ადამიანის მიერ ანოტირებულ მონაცემთა ნიმუშზე ზედამხედველობითი დახვეწის (SFT), უარყოფის შერჩევის (rejection sampling), პროქსიმალური პოლიტიკის ოპტიმიზაციის (PPO) და პირდაპირი პოლიტიკის ოპტიმიზაციის (DPO) კომბინაციით. ლიცენზირების პირობებთან დაკავშირებით, Llama 3 მოყვება ნებართვით ლიცენზიას, რომელიც იძლევა გადაცემის, დახვეწის (fine-tuning) და წარმოებული ნამუშევრების შექმნის საშუალებას. ექსპლიციტური მითითების მოთხოვნა ახალია Llama 3-ის ლიცენზიაში და არ იყო Llama 2-ში. მაგალითად, წარმოებულმა მოდელებმა თავიანთი სახელის დასაწყისში უნდა შეიცავდეს "Llama 3"-ს, ასევე უნდა აღნიშნოთ "Built with Meta Llama 3" წარმოებულ ნამუშევრებში ან სერვისებში. სრული დეტალებისთვის, გთხოვთ, გაეცნოთ ოფიციალურ ლიცენზიას. აქ შეგიძლიათ ნახოთ მოდელების სია და მათი Open LLM Leaderboard ქულები. ეს არ არის ყოვლისმომცველი სია და გირჩევთ, სრულ ლიდერბორდს გადახედოთ. გაითვალისწინეთ, რომ LLM ლიდერბორდი განსაკუთრებით გამოსადეგია წინასწარ გაწვრთნილი მოდელების შესაფასებლად, რადგან არსებობს სხვა ბენჩმარკები, რომლებიც კონკრეტულად სასაუბრო მოდელებისთვისაა განკუთვნილი. საბაზისო მოდელებს არ აქვთ მოთხოვნის ფორმატი (prompt format). სხვა საბაზისო მოდელების მსგავსად, მათი გამოყენება შესაძლებელია შეტანის თანმიმდევრობის დასასრულებლად სარწმუნო გაგრძელებით ან zero-shot/few-shot ინფერენციისთვის. ისინი ასევე შესანიშნავი საფუძველია თქვენი საკუთარი გამოყენების შემთხვევების დასახვეწად. Instruct ვერსიები იყენებენ კონკრეტულ სასაუბრო სტრუქტურას, რომელიც ზუსტად უნდა იყოს რეპროდუცირებული ეფექტური გამოყენებისთვის. მოგვიანებით ვაჩვენებთ, თუ რამდენად ადვილია ინსტრუქციული მოთხოვნის რეპროდუცირება transformers-ში არსებული ჩატის შაბლონით. შეგიძლიათ ესაუბროთ Llama 3 70B instruct-ს Hugging Chat-ზე! იხილეთ ბმული აქ: https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-instruct Transformers-ის 4.40 ვერსიის გამოშვებით, შეგიძლიათ გამოიყენოთ Llama 3 და ისარგებლოთ Hugging Face-ის ეკოსისტემის ყველა ინსტრუმენტით. გარდა ამისა, Llama 3 მოდელები თავსებადია torch.compile()-თან CUDA გრაფებით, რაც მათ ~4-ჯერ აჩქარებას ანიჭებს ინფერენციის დროს. Llama 3 მოდელების transformers-თან გამოსაყენებლად, დარწმუნდით, რომ დააინსტალირეთ transformers-ის უახლესი ვერსია. Llama-3-8b-instruct-ის transformers-თან გამოსაყენებლად საჭიროა დაახლოებით 16 GB ოპერატიული მეხსიერება, რაც მოიცავს სამომხმარებლო GPU-ებს, როგორიცაა 3090 ან 4090.