AI აგენტების გაძლიერება მონაცემთა მეცნიერებაში: Jupyter Agent-იდან Kaggle-ის მაღალი ხარისხის მონაცემებამდე
სტატია დეტალურად აღწერს Jupyter Agent-ის შექმნასა და განვითარებას, ხელოვნური ინტელექტის აგენტის, რომელიც შექმნილია Jupyter Notebook-ებში კოდის უშუალო შესასრულებლად მონაცემთა ანალიზისა და მონაცემთა მეცნიერების ამოცანების გადასაჭრელად. ხაზგასმულია ძალისხმევა მცირე ენობრივი მოდელების გაძლიერებაზე აგენტური ამოცანებისთვის, რათა მათ კონკურენცია გაუწიონ დიდ მოდელებს. პროექტი მოიცავს მაღალი ხარისხის სავარჯიშო მონაცემების გენერირებას Kaggle-ის ნოუთბუქებიდან, მოდელების დახვეწას და მათ შეფასებას DABStep-ის
მრავალსაფეხურიანი კოდის შესრულების მსჯელობასთან ერთად წარმოჩენის ბუნებრივი გზა არის Jupyter Notebook-ის ფარგლებში, რომელიც შედგება კოდისა და მარკდაუნის უჯრებისგან. ამიტომ შევქმენით Jupyter Agent, რათა ის იყოს აგენტი, რომელსაც შეუძლია კოდის შესრულება უშუალოდ Jupyter ნოუთბუქის შიგნით და გამოიყენოს ეს გარემო მონაცემთა ანალიზისა და მონაცემთა მეცნიერების ამოცანების გადასაჭრელად. წარმოიდგინეთ ის, როგორც Cursor, ოღონდ რომელიც მშობლიურად ინტეგრირებულია თქვენს მონაცემთა მეცნიერების სამუშაო პროცესში. ჩვენ შევქმენით ამ ხედვის დემო Qwen-3 Coder-ით, რომელიც ამჟამად ერთ-ერთი უძლიერესი კოდირების მოდელია. ეს არის ჩვენი ადრინდელი ნაშრომის (jupyter-agent v1) გაგრძელება.
მიუხედავად იმისა, რომ დიდი მოდელები იწყებენ სასარგებლო ქცევის გამოვლენას, მთავარი კითხვაა, როგორ შეგვიძლია მათი გაუმჯობესების გაგრძელება. ამ მიზნით, ჩვენ ვამახვილებთ ყურადღებას მცირე მოდელების გაძლიერებაზე, რათა მათ კარგად შეასრულონ აგენტური მონაცემთა მეცნიერების ამოცანები, რადგან ისინი ამჟამად უჭირთ დიდ მოდელებთან კონკურენცია. ამ პროექტის მიზანია შეიქმნას კონვეიერი, რათა ჯერ გენერირდეს მაღალი ხარისხის სავარჯიშო მონაცემები, შემდეგ დახვეწოს არსებული მცირე მოდელი და ბოლოს შეფასდეს, გაუმჯობესდება თუ არა მოდელის შესრულება შესაბამის ბენჩმარკებზე.
დავიწყოთ ბოლო ნაბიჯით: მონაცემთა მეცნიერების ამოცანებზე მოდელების შესაფასებლად ძლიერი ბენჩმარკის შერჩევა. იმის გასაგებად, მივიწევთ თუ არა წინ უკეთესი მონაცემთა მეცნიერების აგენტებისკენ, გვჭირდება ბენჩმარკი ასეთი შესაძლებლობების გასაზომად. გასულ წელს, Adyen-თან პარტნიორობით, წარვადგინეთ DABStep ბენჩმარკი: მონაცემთა მეცნიერების აგენტების რეალისტურ ამოცანებზე შეფასების გზა. დაყენება მარტივია: მიაწოდეთ LLM-ს მონაცემთა ნაკრებები და სთხოვეთ უპასუხოს არატრივიალურ მონაცემთა შეკითხვებს.
მაგალითი ამოცანები: ეს ბენჩმარკი რთულად რჩება დღევანდელი LLM-ებისთვის — მაგალითად, საუკეთესო მზა მოდელი, Claude 4 Sonnet, რთულ ამოცანებზე 20%-იან სიზუსტესაც კი ვერ აღწევს. შეგიძლიათ ნახოთ ცოცხალი ლიდერბორდი აქ.
ახლა, როდესაც გამოვავლინეთ კარგი ბენჩმარკი, შეგვიძლია ვცადოთ მისი დაპყრობა! ჩვენ გადავწყვიტეთ შეგვექმნა მონაცემთა ნაკრები მოდელის დახვეწისთვის ისე, რომ პატარა მონაცემთა აგენტურ მოდელსაც კი შეეძლოს კარგად გამოსვლა DABStep-ზე.
ჩვენი პირველი არჩევანი იყო Qwen3-4B-Thinking-2507: უკიდურესად მცირე (სწრაფი გამეორებისთვის, მარტივი გაშვებისთვის), მაგრამ საკმარისად ძლიერი აგენტურ სცენარებში მოქმედებისთვის.
საწყისი შედეგები: არც ისე კარგი — მაგრამ პერსპექტიული ამოსავალი წერტილი, რადგან ბევრი ადგილი დატოვა გაუმჯობესებისთვის. ვნახოთ, როგორ შეგვიძლია მისი გაუმჯობესება!
აგენტების ერთ-ერთი ძირითადი ასპექტი, რომელიც მათ განასხვავებს წმინდა ჩატ-მოდელებისგან, არის მოდელის ირგვლივ აგებული „სკაფოლდინგი“ მისი ქცევის წარმართვისთვის. მაგალითად, DABStep-ში შეფასების სკრიპტი იყენებს smolagents-ს კოდის შესასრულებლად. Smolagents-ს გააჩნია წინასწარ განსაზღვრული ქცევები, მოთხოვნის სტრუქტურები და მოსალოდნელი ფორმატები.
ჩვენ ასევე შევისწავლეთ Qwen-Agent-ის კოდის ბაზა, სადაც ავტორები „სკაფოლდინგს“ მოდელზე აწყობენ. ეს აზრიანია: Claude Code, მაგალითად, საოცრად კარგად მუშაობს Claude Sonnet-თან, რადგან მათი „სკაფოლდინგი“ შეთანხმებულია.
ამიტომ, ჩვენ რესტრუქტურიზაცია გავუკეთეთ ჩვენს „სკაფოლდინგს“:
👉 იხილეთ აქ: utils.py. შედეგები: სიზუსტე გაიზარდა 44.4%-დან → 59.7%-მდე (მარტივი დაყოფა). 🚀
ჩვენი ციკლი:
გამარტივებული „სკაფოლდინგის“ დანერგვის შემდეგ, ჩვენ ყურადღება გავამახვილეთ Qwen3-4B-ის დახვეწაზე მონაცემთა მეცნიერების აგენტური ამოცანებისთვის.
მოდელის გაუმჯობესების რეცეპტი გარკვეულ ამოცანაზე ან ქცევაზე არის მისი ვარჯიში მონაცემებზე, რომლებიც მაქსიმალურად ზუსტად ასახავს ამოცანებს. ბუნებრივი ამოსავალი წერტილია რეალური Jupyter Notebook-ების შესწავლა და იმ ნოუთბუქების პოვნა, რომლებიც მჭიდროდ ემთხვევა ჩვენს სამიზნე ამოცანას, კერძოდ, მონაცემთა ანალიზს.
Kaggle-ის ნოუთბუქები გვთავაზობს მაღალი ხარისხის მონაცემთა ანალიზის ნოუთბუქების სიმრავლეს და ხელმისაწვდომია Kaggle-ის მიერ: მონაცემთა ნაკრებები:
ახლა, როდესაც გვაქვს კარგი შედეგები საბაზისო მოდელით, დროა შევქმნათ მონაცემთა ნაკრები, რომელიც დაგვეხმარება მის კიდევ უფრო გაუმჯობესებაში. ჩვენ შევქმენით მრავალსაფეხურიანი კონვეიერი Datatrove-ის გამოყენებით, რათა გაგვეწმინდა და მოვემზადებინეთ Kaggle-ის ნოუთბუქები დიდი მასშტაბით.
აი, როგორ მუშაობდა თითოეული ნაბიჯი: ჩვენ დავიწყეთ ~2 ტერაბაიტი Kaggle-ის ნოუთბუქებით და შევამცირეთ ის ~250 გიგაბაიტამდე, BigCode პროექტზე ჩვენი ნამუშევრების ხელახლა გამოყენებით. StarCoder2-ის სავარჯიშო მონაცემების დამუშავების ფარგლებში, ნოუთბუქები (გამომავალი უჯრების გარეშე) უკვე დედუპლიცირებული იყო.
Kaggle-ის ნოუთბუქების უმეტესობა მცირე ვარიაციები ან თითქმის იდენტური ასლებია, ამიტომ ეს ნაბიჯი აუცილებელი იყო. ძირითადი მიგნება: ნედლეული ნოუთბუქების ~90% დუბლიკატია, რამაც გაუფილტრავის შემთხვევაში ვარჯიში დაამახინჯებდა.
Kaggle-ის ნოუთბუქების უმეტესობა გარე მონაცემთა ნაკრებებს Kaggle-ის მეტამონაცემების საშუალებით მიმართავს. იმის უზრუნველსაყოფად, რომ ნოუთბუქებში არსებული კოდი რეალურად იმუშავებდა, ჩვენ შევქმენით კონვეიერი, რომელიც ავტომატურად იღებდა ამ დაკავშირებულ მონაცემთა ნაკრებებს. ეს ნაბიჯი გადამწყვეტი იყო, რადგან ბევრი ნოუთბუქი სხვაგვარად იქნებოდა არასრული ან არა-შესასრულებელი.
kagglehub პაკეტის გამოყენებით, ჩვენ გადმოვწერეთ ათასობით მონაცემთა ნაკრები — საერთო ჯამში დაახლოებით 5 ტერაბაიტი. იმისათვის, რომ ყველაფერი მართვადი და რელევანტური ყოფილიყო:
საბოლოოდ, ჩვენ გვქონდა შესასრულებელი ნოუთბუქების მდიდარი კოლექცია მათ მონაცემთა ნაკრებებთან ერთად, რაც აგენტების რეალისტურ, გაშვებად გარემოში ვარჯიშის საფუძველს იძლეოდა. ჩვენ შევაფასეთ ნოუთბუქები საგანმანათლებლო ხარისხის მიხედვით Qwen3-32B-ის გამოყენებით. ჩვენ დავინახეთ, რომ მთელი ნოუთბუქის გამოყენება არ იყო ოპტიმალური, რადგან ბევრი მათგანი შეიცავდა ტრივიალურ ან გაუმართავ კოდს. ჩვენი საგანმანათლებლო შეფასების მიდგომა დეტალურად არის აღწერილი edu_scoring.py-ში. TL;DR: ჩვენ თითოეულ ნოუთბუქს მივანიჭეთ შეფასება 1-დან 5-მდე სიცხადის, სრულყოფილებისა და საგანმანათლებლო ღირებულების მიხედვით.
თეგები:
#ხელოვნური ინტელექტი
#ai აგენტები
#მონაცემთა მეცნიერება
#მონაცემთა ანალიზი
#ფაინ-ტიუნინგი
#jupyter agent
#მცირე ენობრივი მოდელები
#dabstep
#სკაფოლდინგი
#kaggle
#qwen-3 coder
წყარო: huggingface.co
AI-ით გადამუშავებული
მსგავსი სტატიები
ტექნოლოგიები
Honor Magic V6: უთხელესი დასაკეცი ტელეფონი? პირველი შთაბეჭდილებები
ტექნოლოგიები
Honor Magic V6: ყველაზე თხელი დასაკეცი სმარტფონი და მისი შთამბეჭდავი შესაძლებლობები
ტექნოლოგიები