LLM-ებისთვის განკუთვნილი LMArena-თი შთაგონებულებმა, ჩვენ შევქმენით პლატფორმა, რომელიც ნებისმიერს საშუალებას აძლევს, გვერდიგვერდ შეადაროს კოდის გენერაციის მოდელები, მაგრამ ერთი საკვანძო განსხვავებით: თქვენ შეგიძლიათ რეალურად გაუშვათ კოდი და ნახოთ, რას აწარმოებს ის. უბრალოდ წარმოადგინეთ კოდირების დავალება, დააკვირდით, როგორ ქმნის ორი სხვადასხვა მოდელი ამონახსნებს, გაუშვით ორივე პროგრამა და მიეცით ხმა, თუ რომელი მოდელის შედეგები იყო უკეთესი. მიღებული შედეგები ორგანიზებულია ლიდერბორდში, რომელიც აჩვენებს საზოგადოების მიერ ყველაზე მაღალრეიტინგულ მოდელებს. კოდის გენერაციის სფეროს დიდი ხანია აწყდებოდა სანდო შეფასების მეთოდების პრობლემა. ტრადიციული ბენჩმარკები, როგორიცაა HumanEval, ამოწმებენ კოდს წინასწარ განსაზღვრული სატესტო შემთხვევების მიხედვით, მაგრამ ეს მხოლოდ რეალური პროგრამირების ამოცანების მცირე ნაწილს წარმოადგენს. ადამიანური შეფასების პლატფორმები არსებობს ზოგადი ჩეთბოტებისთვის, მაგრამ ისინი არასაკმარისია კოდისთვის: ნედლი საწყისი კოდის წაკითხვა და მისი გაშვების გონებრივი სიმულაცია კოგნიტურად რთული და შეცდომის მაღალი რისკის შემცველია, განსაკუთრებით ხანგრძლივი პროგრამების ან რთული მომხმარებლის ინტერფეისის აპლიკაციებისთვის. განვიხილოთ შემდეგი სცენარი: თქვენ სთხოვთ ორ ხელოვნური ინტელექტის მოდელს, შექმნას რეაგირებადი ფოტო გალერეის ვებგვერდი. ორივე აგენერირებს კოდს, რომელიც სინტაქსურად სწორად გამოიყურება. მაგრამ რომელია რეალურად უკეთესი? კოდის გაშვების გარეშე, ამის დადგენა თითქმის შეუძლებელია. ერთმა შეიძლება შექმნას ლამაზი, ფუნქციონალური ქსელური განლაგება, მეორეს კი შეიძლება ჰქონდეს დახვეწილი ხარვეზები ან ცუდი სტილი, რომელიც მხოლოდ ბრაუზერში გაშვებისას გამოჩნდება. ამ დაკვირვებამ მიგვიყვანა საკვანძო დასკვნამდე: გაშვების უკუკავშირი აუცილებელია ადამიანებისთვის კოდის ხარისხის საიმედოდ შესაფასებლად. სწორედ ამას გვთავაზობს BigCodeArena. BigCodeArena აფართოებს Chatbot Arena-ს ფრეიმვორკს მძლავრი ფუნქციებით, რომლებიც სპეციალურად კოდის შეფასებისთვისაა შექმნილი: მოდელების მიერ გენერირებული ყოველი კოდის ფრაგმენტი ავტომატურად სრულდება იზოლირებულ სანდბოქს გარემოში. იქნება ეს Python-ის სკრიპტი, React-ის ვებ აპლიკაცია, PyGame თამაში თუ C++ ალგორითმი, თქვენ შეგიძლიათ ნახოთ რეალური გამოსავალი და არა მხოლოდ საწყისი კოდი. ამჟამად ჩვენ მხარს ვუჭერთ 10 ენას (Python, JavaScript, TypeScript, HTML, C, C++, Java, Go, Rust და Markdown) და 8 გაშვების გარემოს: სტატიკური კოდის შედარებისგან განსხვავებით, თქვენ რეალურად შეგიძლიათ ურთიერთქმედება გენერირებულ აპლიკაციებთან: რეალური პროგრამირება არ არის ერთჯერადი პროცესი. BigCodeArena მხარს უჭერს მრავალსვლიან ინტერაქციებს, რაც საშუალებას გაძლევთ დახვეწოთ მოთხოვნები, მოითხოვოთ ფუნქციების დამატება ან ხარვეზების გამოსწორება – ზუსტად ისე, როგორც რეალურ კოდირების ასისტენტთან მუშაობისას. 2025 წლის თებერვალში გაშვების დღიდან, BigCodeArena-მ შეაგროვა 14,000-ზე მეტი საუბარი 500-ზე მეტი უნიკალური მომხმარებლისგან, 4,700-ზე მეტი მაღალი ხარისხის უპირატესობის ხმით, რომლითაც 10 მოწინავე LLM იქნა შედარებული. ჩვენმა მომხმარებლებმა გამოიკვლიეს საოცრად მრავალფეროვანი კოდირების სცენარები: Python დომინირებს 4,000-ზე მეტი საუბრით, რასაც მოსდევს JavaScript/TypeScript (3,359), HTML (1,601) და C++ (642). ფრეიმვორკებს შორის, Python-ის პირდაპირი ინტერპრეტატორები ლიდერობენ გამოყენების მხრივ (6,000 სესია), ხოლო React (2,729), Core Web (1,574), Streamlit (1,254) და PyGame (1,087) ასევე ფართოდ გამოიყენება. ინტერაქციების უმეტესობა ფოკუსირებული და ეფექტურია: საუბრების 76% შედგება მხოლოდ 2 სვლისგან (ერთი მოთხოვნა, ერთი პასუხი), საუბრის საშუალო ხანგრძლივობაა 4.12 შეტყობინება. თუმცა, პლატფორმა საჭიროების შემთხვევაში მხარს უჭერს გაფართოებულ მრავალსვლიან გამართვის სესიებს, ზოგიერთი საუბარი 10 სვლასაც აღემატება, რადგან მომხმარებლები ართულებენ აპლიკაციებს. ჩვენი 14 ათასი საუბრიდან, ჩვენ გავფილტრეთ მაღალი ხარისხის წყვილთა შედარებები: საუბრები მინიმუმ ორი სვლით და კოდის რეალური გაშვებით. ამან მოგვცა 4,731 ხმის ნიმუში, სადაც თითოეულმა შეფასებულმა მოდელმა მინიმუმ 700 ხმა მიიღო. ჩვენ ამ ხმებს ვაერთიანებთ Elo რეიტინგებში ბრედლი-ტერიის მოდელის გამოყენებით, რომელიც აფასებს იმის ალბათობას, რომ ერთი მოდელი მეორეს აჯობებს პირისპირ შედარებების საფუძველზე. რეიტინგების სიმტკიცის უზრუნველსაყოფად, ჩვენ ვიყენებთ 100 ბუტსტრაპულ ნიმუშს 95%-იანი სანდო ინტერვალების ასაგებად, რათა შევძლოთ მოდელებს შორის სტატისტიკურად მნიშვნელოვანი მუშაობის განსხვავებების იდენტიფიცირება. ჩვენ ვაფასებთ მოდელებს სამი პარამეტრის მიხედვით სხვადასხვა ფაქტორების გასაკონტროლებლად: რეიტინგები საოცრად თანმიმდევრული რჩება სამივე პარამეტრზე, რაც ნათლად აჩვენებს მუშაობის დონეებს: უმაღლესი დონე: o3-mini და o1-mini მუდმივად ლიდერობენ უმაღლესი Elo რეიტინგებით და ვიწრო სანდო ინტერვალებით. ეს მოდელები ინარჩუნებენ საუკეთესო მუშაობას გარემოსა თუ ენის შეზღუდვების მიუხედავად, რაც აჩვენებს ძლიერ სიმტკიცეს კოდირების სხვადასხვა სცენარში. Claude-3.5-Sonnet მჭიდროდ მიჰყვება მათ, განსაკუთრებით გამოირჩევა, როდესაც ენა კონტროლდება. საშუალო დონე: GPT-4o, o1 და Gemini-2.0-Pro/Flash ქმნიან კონკურენტულ საშუალო დონეს. GPT-4o აჩვენებს გარკვეულ მგრძნობელობას ენის შესატყვისობასთან მიმართებაში, რაც მიუთითებს მრავალენოვანი თანმიმდევრულობის გაუმჯობესების შესაძლებლობაზე. ღია კოდის მოდელები: Qwen2.5-ის ვარიანტები და Llama-3.3-70B ჩამორჩებიან მოწინავე საკუთრებად მოდელებს, რაც ხაზს უსვამს შესრულების უფსკრულს, რომელიც რჩება წამყვან დახურულ და ღია მოდელებს შორის. სურათი: თითოეული მოდელის საერთო მოგების სიხშირის თერმული რუკები (ყველა წყვილთა შედარების მოგებული პროცენტული მაჩვენებელი) სესიებში ენების (მარცხნივ) და გაშვების გარემოების (მარჯვნივ) მიხედვით. თითოეული კატეგორიისთვის, ჩვენ ვინახავთ მხოლოდ იმ მოდელებს, რომლებიც გამოჩნდა მინიმუმ 3 საუბრის სესიაში. შესრულების პროგრამირების ენების მიხედვით დაყოფა საინტერესო ნიმუშებს ავლენს, რომელთა დეტალური ანალიზი შემდგომ კვლევებს საჭიროებს.