SafeCoder-ის მიზანია საწარმოებისთვის პროგრამული უზრუნველყოფის შემუშავების პროდუქტიულობის გაზრდა, სრულად შესაბამისი და თვით-ჰოსტინგით განლაგებული AI პროგრამისტის მეშვეობით. მარკეტინგული თვალსაზრისით, ეს არის „თქვენი საკუთარი, ადგილობრივად განთავსებული GitHub Copilot“. სანამ სიღრმისეულად განვიხილავთ, აი, რა უნდა იცოდეთ: LLM-ებზე დაფუძნებული კოდის ასისტენტების გადაწყვეტილებები, როგორიცაა GitHub Copilot, მნიშვნელოვნად ზრდის პროდუქტიულობას. საწარმოებისთვის, კომპანიის კოდების ბაზაზე Code LLM-ების ოპტიმიზაციისა და საკუთრებად არსებული Code LLM-ების შექმნის შესაძლებლობა აუმჯობესებს კოდის დასრულებების სანდოობასა და რელევანტურობას, რაც პროდუქტიულობის კიდევ ერთ დონეს ქმნის. მაგალითად, Google-ის შიდა LLM კოდის ასისტენტის მიხედვით, შიდა კოდების ბაზაზე ვარჯიშის შედეგად კოდის დასრულებების მიღების მაჩვენებელი 25-34%-ია. თუმცა, შიდა კოდის ასისტენტების შესაქმნელად დახურული წყაროს Code LLM-ებზე დაყრდნობა კომპანიებს შესაბამისობისა და უსაფრთხოების საკითხების წინაშე აყენებს. პირველ რიგში, სწავლების პროცესში, რადგან დახურული წყაროს Code LLM-ის შიდა კოდების ბაზაზე დახვეწა მოითხოვს ამ კოდების ბაზის მესამე მხარისთვის გაზიარებას. შემდეგ კი ინფერენციის დროს, რადგან დახვეწილ Code LLM-ებს შეუძლიათ კოდის „გაჟონვა“ მათი სასწავლო მონაცემთა ნაკრებიდან ინფერენციის პერიოდში. შესაბამისობის მოთხოვნების დასაკმაყოფილებლად, საწარმოებს სჭირდებათ დახვეწილი Code LLM-ების განლაგება საკუთარ ინფრასტრუქტურაში — რაც შეუძლებელია დახურული წყაროს LLM-ებით. SafeCoder-ის საშუალებით Hugging Face დაეხმარება მომხმარებლებს შექმნან საკუთარი Code LLM-ები, დახვეწილი მათი საკუთრებად არსებული კოდების ბაზაზე, უახლესი ღია მოდელებისა და ბიბლიოთეკების გამოყენებით, საკუთარი კოდის Hugging Face-თან ან ნებისმიერ სხვა მესამე მხარესთან გაზიარების გარეშე. SafeCoder-ით Hugging Face გთავაზობთ კონტეინერიზებულ, აპარატურულად აჩქარებულ Code LLM-ის ინფერენციის გადაწყვეტილებას, რომელიც მომხმარებლის მიერ პირდაპირ მათ უსაფრთხო ინფრასტრუქტურაში განლაგდება, კოდის შეტანისას და დასრულებისას მათი უსაფრთხო IT გარემოს დატოვების გარეშე. SafeCoder გადაწყვეტილების გულში დევს StarCoder Code LLM-ების ოჯახი, შექმნილი BigCode პროექტის მიერ, რომელიც Hugging Face-ის, ServiceNow-ისა და ღია კოდის საზოგადოების თანამშრომლობის შედეგია. StarCoder-ის მოდელები გვთავაზობენ უნიკალურ მახასიათებლებს, რომლებიც იდეალურად შეეფერება საწარმოების თვით-ჰოსტინგის გადაწყვეტას: შენიშვნა: მიუხედავად იმისა, რომ StarCoder არის SafeCoder-ის საწყისი ვერსიის შთაგონება და მოდელი, LLM გადაწყვეტილების ღია კოდის მოდელებზე აგების მნიშვნელოვანი უპირატესობა ის არის, რომ მას შეუძლია მოერგოს უახლეს და საუკეთესო ღია კოდის მოდელებს. მომავალში, SafeCoder-მა შეიძლება შესთავაზოს სხვა მსგავსი კომერციულად დასაშვები ღია კოდის მოდელები, რომლებიც აგებულია ეთიკურად მოპოვებულ და გამჭვირვალე მონაცემთა ნაკრებებზე, როგორც ძირითადი LLM-ები დახვეწისთვის. ნებისმიერი კომპანიისთვის, შიდა კოდების ბაზა მისი ერთ-ერთი ყველაზე მნიშვნელოვანი და ღირებული ინტელექტუალური საკუთრებაა. SafeCoder-ის ერთ-ერთი ძირითადი პრინციპია, რომ მომხმარებლის შიდა კოდების ბაზა არასოდეს იქნება ხელმისაწვდომი ნებისმიერი მესამე მხარისთვის (მათ შორის Hugging Face-ისთვის) არც სწავლების და არც ინფერენციის დროს. SafeCoder-ის საწყისი დაყენების ფაზაში Hugging Face-ის გუნდი აწვდის კონტეინერებს, სკრიპტებსა და მაგალითებს, რათა მომხმარებელთან ერთად იმუშაოს შიდა კოდების ბაზის მონაცემების შესარჩევად, ამოსაღებად, მოსამზადებლად, დუბლირებისა და დეიდენტიფიკაციისთვის, რათა შეიქმნას სასწავლო მონაცემთა ნაკრები, რომელიც გამოყენებული იქნება Hugging Face-ის მიერ მოწოდებულ სასწავლო კონტეინერში, მომხმარებლისთვის ხელმისაწვდომი აპარატურული ინფრასტრუქტურის მიხედვით. SafeCoder-ის განლაგების ფაზაში, მომხმარებელი საკუთარ ინფრასტრუქტურაზე ათავსებს Hugging Face-ის მიერ მოწოდებულ კონტეინერებს, რათა მათ VPC-ში გამოაჩინოს შიდა კერძო წერტილები. ეს კონტეინერები კონფიგურირებულია მომხმარებლისთვის ხელმისაწვდომი ზუსტი აპარატურული კონფიგურაციის მიხედვით, მათ შორის NVIDIA GPU-ები, AMD Instinct GPU-ები, Intel Xeon CPU-ები, AWS Inferentia2 ან Habana Gaudi ამაჩქარებლები. ვინაიდან მანქანური სწავლების მოდელებისა და მონაცემთა ნაკრებების მარეგულირებელი ჩარჩო ჯერ კიდევ იწერება მთელ მსოფლიოში, გლობალურმა კომპანიებმა უნდა უზრუნველყონ, რომ მათ მიერ გამოყენებული გადაწყვეტილებები მინიმუმამდე დაიყვანოს სამართლებრივი რისკები. მონაცემთა წყაროები, მონაცემთა მართვა, საავტორო უფლებებით დაცული მონაცემების მართვა მხოლოდ რამდენიმეა იმ მნიშვნელოვანი შესაბამისობის სფეროდან, რომელთა გათვალისწინებაც აუცილებელია. BigScience-მა, BigCode-ის წინამორბედმა და შთაგონებამ, განიხილა ეს სფეროები სამუშაო ჯგუფებში, სანამ მათ ფართოდ აღიარებდა ევროკავშირის AI კანონის პროექტი, რის შედეგადაც სტენფორდის CRFM კვლევაში ის შეფასდა, როგორც ყველაზე შესაბამისი ფუნდამენტური მოდელების პროვაიდერებს შორის. BigCode-მ გააფართოვა ეს სამუშაო კოდის სფეროსთვის ახალი ტექნიკის დანერგვით და The Stack-ის შექმნით, რომლის ძირითადი პრინციპი შესაბამისობაა. ეს მოიცავს კომერციულად დასაშვები ლიცენზიის ფილტრაციას, თანხმობის მექანიზმებს (დეველოპერებს შეუძლიათ ადვილად გაარკვიონ, არის თუ არა მათი კოდი წარმოდგენილი და მოითხოვონ მონაცემთა ნაკრებიდან ამოღება), ასევე ვრცელ დოკუმენტაციას და ინსტრუმენტებს საწყისი მონაცემების შესამოწმებლად და მონაცემთა ნაკრების გაუმჯობესებებს (როგორიცაა დედუპლიკაცია და PII-ის ამოღება). ყველა ეს ძალისხმევა იურიდიული რისკის მინიმიზაციას ნიშნავს StarCoder მოდელების მომხმარებლებისთვის და SafeCoder-ის კლიენტებისთვის. SafeCoder-ის მომხმარებლებისთვის კი ეს ძალისხმევა შესაბამისობის ფუნქციებად იქცევა: როდესაც პროგრამული უზრუნველყოფის დეველოპერები იღებენ კოდის დასრულებებს, ეს შემოთავაზებები შემოწმდება The Stack-ის წინააღმდეგ, რათა მომხმარებლებმა იცოდნენ, ემთხვევა თუ არა შემოთავაზებული კოდი საწყის მონაცემთა ნაკრებში არსებულ კოდს და რა არის ლიცენზია. მომხმარებლებს შეუძლიათ მიუთითონ, რომელი ლიცენზიებია სასურველი და გამოაჩინონ...