„ფალკონ3“ წარმოადგენს წინა ვერსიების ბუნებრივ ევოლუციას, რომელიც ფოკუსირებულია მოდელების სამეცნიერო, მათემატიკურ და კოდირების შესაძლებლობების გაფართოებაზე. ეს იტერაცია მოიცავს ხუთ საბაზისო მოდელს. ამ მოდელების შემუშავებისას, ჩვენ შევიტანეთ რამდენიმე საკვანძო ინოვაცია, რომელთა მიზანია მოდელების წარმადობის გაუმჯობესება წვრთნის ხარჯების შემცირებით. „ფალკონ3“-მა აჩვენა დიდი ენობრივი მოდელების მცირე და საშუალო მასშტაბების ლიმიტები, რაც დასტურდება საერთო საორიენტაციო ტესტებზე მაღალი წარმადობით. მოდელები შევაფასეთ ჩვენი შიდა შეფასების სისტემის მეშვეობით (lm-evaluation-harness-ზე დაფუძნებული) და წარმოგიდგენთ ნედლ ქულებს. ჩვენი შეფასებები ხაზს უსვამს იმ ძირითად სფეროებს, სადაც „ფალკონ3“-ის მოდელების ოჯახი გამორჩეულია, რაც ასახავს აქცენტს სამეცნიერო დომენებში, მსჯელობასა და ზოგადი ცოდნის შესაძლებლობების გაუმჯობესებაზე. „ფალკონ3“-ის მოდელების ოჯახის დეტალური სპეციფიკაციები შეჯამებულია მოცემულ ცხრილში. „ფალკონ3-7B-Base“-ის არქიტექტურა ხასიათდება 256 თავის განზომილებით (head dimension), რაც უზრუნველყოფს მაღალ გამტარუნარიანობას FlashAttention-3-ის გამოყენებისას, ვინაიდან ის ოპტიმიზებულია ამ განზომილებისთვის. ეს მხოლოდ-დეკოდერული მოდელები მოიცავს 18-დან 40-მდე ფენას ტრანსფორმატორზე დაფუძნებული მოდელებისთვის, ხოლო 64 ფენას „მამბას“ მოდელისთვის. ყველა მოდელი იზიარებს SwiGLU გააქტიურების ფუნქციას, 131K ტოკენის ლექსიკონის ზომით (65K „მამბა-7B“-ისთვის). „ფალკონ3-7B-Base“ გაწვრთნილია მონაცემთა ყველაზე დიდ მოცულობაზე, რაც უზრუნველყოფს კონცეფციებისა და ცოდნის ყოვლისმომცველ დაფარვას, ხოლო სხვა ვარიანტებს გაცილებით ნაკლები მონაცემები სჭირდება. ქვემოთ მოცემული ცხრილი ხაზს უსვამს „ფალკონ3-7B-Base“-ისა და „ფალკონ3-10B-Base“-ის წარმადობას ძირითად საორიენტაციო ტესტებზე, რაც აჩვენებს კონკურენტულ შედეგებს ზოგად, მათემატიკურ, მსჯელობისა და საღი აზრის გაგების დომენებში. თქვენ შეგიძლიათ გაეცნოთ მოდელების ბარათებს, სადაც წარმოდგენილია დამატებითი შეფასების შედეგები (მაგ., MT-Bench, Alpaca და სხვა). ინსტრუქციული მოდელები ასევე აჩვენებენ კონკურენტულ და მაღალ წარმადობას ექვივალენტური და მცირე ზომის მოდელებთან შედარებით, როგორც ეს მოცემულია ქვემოთ მოცემულ ცხრილებში. „ფალკონ3-1B-Instruct“ და „ფალკონ3-3B-Instruct“ აღწევენ ძლიერ წარმადობას შეფასებულ საორიენტაციო ტესტებზე. კერძოდ, „ფალკონ3-1B“ აღწევს კონკურენტულ შედეგებს IFEval-ში (54.4), MUSR-ში (40.7) და SciQ-ში (86.8), ხოლო „ფალკონ3-3B“ აჩვენებს შემდგომ გაუმჯობესებას — განსაკუთრებით MMLU-PRO-ში (29.7) და MATH-ში (19.9) — რაც ცხადყოფს მასშტაბირების მკაფიო ეფექტებს. მიუხედავად იმისა, რომ ისინი არ აღემატებიან ყველა კონკურენტ მოდელს ყველა მეტრიკაზე, „ფალკონ“-ის მოდელები აჩვენებენ ძლიერ წარმადობას მსჯელობისა და საღი აზრის გაგებაში როგორც Qwen-თან, ასევე Llama-სთან შედარებით. ჩვენი შიდა შეფასების სისტემის თანახმად: ჩვენი მისიის შესაბამისად, ხელი შევუწყოთ ხელოვნური ინტელექტის ხელმისაწვდომობასა და თანამშრომლობას, „ფალკონ3“-ის ოჯახის ყველა მოდელი გამოქვეყნებულია Falcon LLM ლიცენზიით. ვიმედოვნებთ, რომ ხელოვნური ინტელექტის საზოგადოება ამ მოდელებს ღირებულად მიიჩნევს კვლევებისთვის, აპლიკაციების შემუშავებისა და შემდგომი ექსპერიმენტებისთვის. „ფალკონ3“ არ არის კულმინაცია, არამედ ჩვენი ძალისხმევის გაგრძელება უფრო ქმედითი, ეფექტური და სპეციალიზებული ფუნდამენტური მოდელების შესაქმნელად. 2025 წლის იანვარში, ჩვენ გამოვაქვეყნებთ „ფალკონ3“-ის ოჯახის სხვა მოდელებს, რომლებიც აღჭურვილი იქნება გაუმჯობესებული მულტიმოდალური შესაძლებლობებით, მათ შორის გამოსახულების, ვიდეოსა და აუდიოს მხარდაჭერით, ასევე სრულ ტექნიკურ ანგარიშს ჩვენი მეთოდოლოგიების შესახებ. მივესალმებით უკუკავშირს და თანამშრომლობას საზოგადოებისგან, რადგან ვაგრძელებთ ამ ტექნოლოგიების დახვეწასა და განვითარებას. თბილად ვუხდით მადლობას შემდეგ პირებს ეკოსისტემაში შეუფერხებელი მხარდაჭერისა და ინტეგრაციისთვის. თუ „ფალკონ3“-ის მოდელების ოჯახი გამოსადეგი იყო თქვენი მუშაობისთვის, მოგერიდებათ ჩვენი ციტირება.