ტექნოლოგიურ სამყაროში მნიშვნელოვანი სიახლეა: კომპანია Meta-მ დღეს გამოუშვა Llama 2 – თანამედროვე, ღია წვდომის დიდი ენობრივი მოდელების (LLM) ოჯახი, რომლის სრულ ინტეგრაციას Hugging Face-ში ჩვენ აღფრთოვანებით ვუჭერთ მხარს. ეს ინიციატივა განსაკუთრებულია, რადგან Llama 2 გამოდის ძალიან ლიბერალური საზოგადოებრივი ლიცენზიით და ხელმისაწვდომია კომერციული გამოყენებისთვის, რაც მას დეველოპერებისა და ბიზნესებისთვის მიმზიდველ არჩევანს ხდის. კოდი, წინასწარ გაწვრთნილი მოდელები და დახვეწილი მოდელები – ყველა დღეს გამოვა. ჩვენ ვითანამშრომლეთ Meta-სთან, რათა უზრუნველგვეყო მისი შეუფერხებელი ინტეგრაცია Hugging Face-ის ეკოსისტემაში. ამჟამად ჰაბზე ხელმისაწვდომია 12 ღია წვდომის მოდელი (3 ძირითადი მოდელი და 3 დახვეწილი მოდელი Meta-ს ორიგინალური საკონტროლო წერტილებით, ასევე მათი შესაბამისი ტრანსფორმერების მოდელები). Llama 2-ის გამოშვება წარმოადგენს წინასწარ გაწვრთნილი და დახვეწილი LLM-ების ოჯახს, რომელთა მასშტაბი 7B-დან 70B პარამეტრამდე მერყეობს (7B, 13B, 70B). წინასწარ გაწვრთნილი მოდელები Llama 1-ის მოდელებთან შედარებით მნიშვნელოვანი გაუმჯობესებებით გამოირჩევა, მათ შორის: გაწვრთნილია 40%-ით მეტ ტოკენზე, აქვს ბევრად უფრო გრძელი კონტექსტის სიგრძე (4000 ტოკენი) და იყენებს დაჯგუფებული მოთხოვნის ყურადღებას (grouped-query attention) 70B მოდელის სწრაფი ინფერენციისთვის. თუმცა, ამ გამოშვების ყველაზე ამაღელვებელი ნაწილი დახვეწილი მოდელებია (Llama 2-Chat), რომლებიც ოპტიმიზებულია დიალოგური აპლიკაციებისთვის ადამიანის უკუკავშირიდან გამაგრების სწავლის (RLHF) გამოყენებით. სარგებლიანობისა და უსაფრთხოების ფართო სპექტრის ბენჩმარკებზე Llama 2-Chat მოდელები აჩვენებენ უკეთეს შედეგებს, ვიდრე უმეტესობა ღია მოდელები, და ადამიანური შეფასებების მიხედვით, აღწევენ ChatGPT-ის მსგავს შესრულებას. (მითითება ნაშრომზე: "Llama 2: Open Foundation and Fine-Tuned Chat Models"). თუ დახურული კოდის ჩეთბოტების ღია ალტერნატივას ელოდით, Llama 2-Chat, სავარაუდოდ, თქვენი საუკეთესო არჩევანია დღეს! (შენიშვნა: ნოემბერში დანერგილი ახალი მეთოდოლოგიის გათვალისწინებით, Llama 2-Chat მოდელების შესრულების ქულები განახლდა, რამაც ახალი ბენჩმარკები დაამატა. დეტალები იხილეთ შესაბამის პუბლიკაციაში). **Llama 2-ის გამოყენება Hugging Face-ის საშუალებით** მომხმარებლებს შეუძლიათ მარტივად გამოსცადონ 13B Llama 2 მოდელი Hugging Face-ის Space-ში ან ინტეგრირებულ სათამაშო მოედანზე. Llama 2 მოდელებზე ინფერენციის გაშვების სხვადასხვა მიდგომის შესახებ დეტალური ინფორმაცია ხელმისაწვდომია Hugging Face-ის პლატფორმაზე. ამ მოდელების გამოყენებამდე აუცილებელია წვდომის მოთხოვნა Meta-ს ოფიციალურ Llama 2 რეპოზიტორებში და შესაბამისი Meta-ს ოფიციალური ფორმის შევსება. წვდომა მომხმარებლებს ორივე ფორმის შევსებიდან რამდენიმე საათში მიენიჭებათ. Transformers-ის 4.31 ვერსიის გამოშვებით, უკვე შესაძლებელია Llama 2-ის გამოყენება და Hugging Face (HF) ეკოსისტემის ყველა ხელსაწყოს გამოყენება. მნიშვნელოვანია transformers-ის უახლესი ვერსიის გამოყენება და Hugging Face-ის ანგარიშზე შესვლა. ინფერენციის გაშვება შესაძლებელია transformers-ის საშუალებით, მათ შორის Colab-ის უფასო ვერსიაზე GPU runtime-ის არჩევის შემთხვევაში. მიუხედავად იმისა, რომ მოდელს აქვს მხოლოდ 4000 ტოკენის კონტექსტი, შესაძლებელია transformers-ის მიერ მხარდაჭერილი ტექნიკების, მაგალითად, rotary position embedding scaling-ის გამოყენება მისი შესაძლებლობების გასაფართოებლად. **Text Generation Inference და განლაგება (Deployment)** Text Generation Inference არის წარმოებისთვის მზა ინფერენციის კონტეინერი, რომელიც Hugging Face-ის მიერ არის შემუშავებული დიდი ენობრივი მოდელების მარტივი განლაგებისთვის. მას აქვს ისეთი ფუნქციები, როგორიცაა უწყვეტი დაჯგუფება (continuous batching), ტოკენების სტრიმინგი, ტენზორული პარალელიზმი მრავალ GPU-ზე სწრაფი ინფერენციისთვის და წარმოებისთვის მზა ჟურნალის წარმოება (logging) და მიკვლევა (tracing). შესაძლებელია Text Generation Inference-ის გამოცდა საკუთარ ინფრასტრუქტურაზე, ან Hugging Face-ის Inference Endpoints-ის გამოყენება. Llama 2 მოდელის განსათავსებლად, უნდა გადახვიდეთ მოდელის გვერდზე და დააჭიროთ "Deploy -> Inference Endpoints" ვიჯეტს. (შენიშვნა: A100s-ზე წვდომისთვის შესაძლოა დაგჭირდეთ კვოტის განახლების მოთხოვნა ელფოსტით [email protected]ზე). LLM-ების Hugging Face Inference Endpoints-ის საშუალებით განლაგების შესახებ მეტი ინფორმაცია ხელმისაწვდომია Hugging Face-ის ბლოგზე, რომელიც შეიცავს მონაცემებს მხარდაჭერილი ჰიპერპარამეტრების შესახებ და როგორ მოახდინოთ პასუხის სტრიმინგი Python-ისა და Javascript-ის გამოყენებით. **LLM-ების გაწვრთნა და დახვეწა** LLM-ების გაწვრთნა ტექნიკურად და გამოთვლითად შეიძლება იყოს რთული. Hugging Face ეკოსისტემაში არსებობს ინსტრუმენტები Llama 2-ის ეფექტურად გასაწვრთნელად მარტივ აპარატურაზე. მაგალითად, ნაჩვენებია, თუ როგორ უნდა დახვეწოთ Llama 2-ის 7B ვერსია ერთ NVIDIA T4-ზე (16GB - Google Colab). მეტი დეტალი ამის შესახებ შეგიძლიათ იხილოთ ბლოგში "Making LLMs even more accessible". Hugging Face-მა შექმნა სკრიპტი Llama 2-ის ინსტრუქციული დახვეწისთვის QLoRA-სა და trl-ის SFTTrainer-ის გამოყენებით. ამ სკრიპტს შეუძლია LoRA წონების მოდელის წონებში შერწყმა და მათი safetensor წონებად შენახვა, რაც საშუალებას იძლევა, გაწვრთნის შემდეგ დახვეწილი მოდელი განლაგდეს text-generation-inference-ისა და inference endpoints-ის გამოყენებით. **ღია წვდომის უპირატესობები** ღია წვდომის მოდელების ერთ-ერთი უმნიშვნელოვანესი უპირატესობა ის არის, რომ მომხმარებელს აქვს სრული კონტროლი სისტემის მოთხოვნაზე (system prompt) ჩატის აპლიკაციებში. ეს გადამწყვეტია ჩატის ასისტენტის ქცევის დასაზუსტებლად – და მისთვის გარკვეული პიროვნული თვისებების მისანიჭებლად – რაც მიუწვდომელია სერვისის სახით მიწოდებულ მოდელებში.