მოკლე მიმოხილვა: ჩვენ შევქმენით აგენტის უნარი, რომელიც კოდირების აგენტებს ასწავლის საწარმოო დონის CUDA ქერნელების წერას. შემდეგ ჩვენ Claude-ი და Codex-ი მივმართეთ ორ რეალურ სამიზნესთან: diffusers-ის კონვეიერთან და transformers-ის მოდელთან. აგენტებმა ორივესთვის შექმნეს მოქმედი ქერნელები, სწორი PyTorch მიბმულობებითა და წარმადობის ტესტებით, სრულად. CUDA ქერნელების წერა რთულია. კიდევ უფრო რთულია ისეთი CUDA ქერნელების შექმნა, რომლებიც სწორად ინტეგრირდება transformers-სა და diffusers-თან. არსებობს არქიტექტურის სპეციფიკური მეხსიერების წვდომის ნიმუშები, ვექტორიზაციის სტრატეგიები, warp shuffle-ის შემცირებები და ათობით ინტეგრაციის ხაფანგი, რომლებიც გამოცდილ დეველოპერებსაც კი უქმნის პრობლემებს. ეს არის ზუსტად ისეთი სპეციალიზებული, მაღალი რისკის მქონე პრობლემა, სადაც აგენტის უნარები საუკეთესოდ ვლინდება. ჩვენ კოდირების აგენტებს მივეცით საჭირო დომენის ცოდნა, მაგალითად, თუ რომელი GPU არქიტექტურა უნდა იყოს სამიზნე, როგორ მოხდეს ქერნელის მშენებელი პროექტის სტრუქტურირება, როდის უნდა იქნას გამოყენებული საერთო მეხსიერება რეგისტრების ნაცვლად და როგორ დაიწეროს PyTorch-ის მიბმულობები. დანარჩენი აგენტებმა გააკეთეს. თუ თქვენ გამოგიყენებიათ LLM-ის წვრთნის უნარი ან წაგიკითხავთ „ჩვენ ვასწავლეთ Claude-ს ღია მოდელების სწავლება“, ეს ნიმუში ნაცნობი მოგეჩვენებათ: დომენის ექსპერტიზა ჩაალაგეთ უნარში, მიმართეთ აგენტი პრობლემისკენ და მიეცით საშუალება, იმუშაოს. Kernel Hub-მა გადაჭრა მორგებული აპარატურული ქერნელების დისტრიბუციის პრობლემა. შეგიძლიათ წინასწარ კომპილირებული ქერნელები ჩატვირთოთ Hub-იდან ერთი get_kernel გამოძახებით. არანაირი აწყობა, არანაირი დროშები. თუმცა, ქერნელების დაწერა მაინც ვინმეს სჭირდება. სწორედ ამ ხარვეზს ავსებს ეს უნარი. CUDA ქერნელის შემუშავებას აქვს უზარმაზარი ზედაპირი: ეს არის დომენის ცოდნა, რომელიც იკარგება დოკუმენტაციის ჩანართებსა და Stack Overflow-ის პასუხებში. აგენტის უნარი მას ათავსებს კონტექსტში, რომელიც იტვირთება მოთხოვნისთანავე. პირველ რიგში, ვაჩვენოთ, როგორ გამოვიყენოთ ეს უნარი დაუყოვნებლივ, შემდეგ კი დეტალურად განვიხილოთ, თუ როგორ ჩავატარეთ ქერნელების წარმადობის ტესტირება. ეს უნარი მოყვება ქერნელების ბიბლიოთეკას. დააინსტალირეთ ის თქვენს კოდირების აგენტში ერთი ბრძანებით: ეს უნარს ათავსებს .claude/skills/cuda-kernels/-ში, საიდანაც Claude Code და Cursor მას ავტომატურად აღმოაჩენენ. სხვა აგენტებისთვის: ინსტალაციის შემდეგ, მიეცით მითითება თქვენს აგენტს: ან შეგიძლიათ მიმართოთ უფრო ღია ხასიათის დავალებას: აგენტს შეუძლია წაიკითხოს უნარი, შეარჩიოს სწორი არქიტექტურული პარამეტრები, შექმნას CUDA წყარო კოდი, დაწეროს PyTorch-ის მიბმულობები, დააყენოს build.toml და შექმნას წარმადობის ტესტირების სკრიპტი. თუ უფრო კომპლექსურ ქერნელებზე ან არქიტექტურის სპეციფიკურ ოპტიმიზაციებზე მუშაობთ, რომლებიც არ არის გათვალისწინებული ამ უნარში, მაშინ უნარი გთავაზობთ ფუნდამენტურ სამშენებლო ბლოკებსა და შაბლონებს დასაწყებად. ჩვენ ასევე მზად ვართ მივიღოთ წვლილი თავად უნარის განვითარებაში. უნარი მოიცავს დაახლოებით 550 ტოკენს სტრუქტურირებული მითითებების სახით, პლუს საცნობარო სკრიპტებს, GPU ოპტიმიზაციის სახელმძღვანელოებს, პრობლემების აღმოფხვრის დოკუმენტაციას და სრულფასოვან სამუშაო მაგალითებს. აგენტურული კოდირების ხელსაწყოებს, როგორიცაა Codex და Claude, შეუძლიათ ამის წაკითხვა და ფუნქციური ქერნელის პროექტის შექმნა. ის მოიცავს: როდესაც აგენტი ამას ჩატვირთავს, ის იღებს ყველაფერს, რაც სჭირდება "დამიწერე RMSNorm ქერნელი"-დან აწყობილ, ტესტირებად პროექტამდე მისასვლელად. ის მოძებნის უნარში შესაბამის ფაილებსა და დირექტორიებს. ამიტომ მნიშვნელოვანია უნარის სტრუქტურირება ისე, რომ მისი პოვნა ადვილი იყოს. აგენტს დაევალა შექმნას ქერნელები, რომლებიც შეესაბამება references/kernel-templates.md-ში მოცემულ შაბლონებს და წარმოადგინოს სრული ქერნელის პროექტი: ჩვენ ეს ორ რეალურ სამიზნეზე გამოვცადეთ. აგენტმა შექმნა RMSNorm, RoPE 3D, GEGLU და AdaLN ქერნელები LTX-Video-სთვის, რომელიც არის ვიდეოს გენერაციის კონვეიერი diffusers-დან. სრული მაგალითი ხელმისაწვდომია examples/ltx_video/-ში. ჩვენ მოვახდინეთ RMSNorm ქერნელის ოპტიმიზაცია H100-ისთვის. ორივე წარმადობის ტესტი ჩატარდა H100 80GB HBM3-ზე BFloat16 სიზუსტით. თუ გსურთ იხილოთ გენერირებული ქერნელი, ეწვიეთ ამ მაგალითს. პირველ რიგში, ჩვენ შევადარეთ იზოლირებული RMSNorm ქერნელის წარმადობა PyTorch-ის საბაზისო მონაცემებს. ეს არის ძირითადი დაჩქარება ოპტიმიზებულ კონვეიერში. საშუალო დაჩქარება: 1.88x და გამტარუნარიანობის ეფექტურობა: H100-ის თეორიული (3,350 GB/წმ) 34.7%. შემდეგ, ჩვენ შევადარეთ ოპტიმიზებული ქერნელების ვიდეოს გენერაციის ბოლოდან-ბოლომდე წარმადობა საბაზისო (კომპილაციის გარეშე) და torch.compile საბაზისო მონაცემებს. RMSNorm შეადგენს LTX-Video-ში მთლიანი გამოთვლითი რესურსის დაახლოებით 5%-ს. დარჩენილი დრო იხარჯება ყურადღებაზე (attention), ხაზოვან პროექციებსა და VAE დეკოდირებაზე. 6%-იანი ბოლოდან-ბოლომდე დაჩქარება ერთი ტიპის ქერნელისგან თანმიმდევრულია ამ პროფილთან. აგენტმა შექმნა RMSNorm ქერნელი Qwen3-8B-ისთვის, დიდი ენობრივი მოდელისთვის transformers-დან, რომელსაც აქვს 65 RMSNorm მოდული 32 ფენაზე. სრული მაგალითი ხელმისაწვდომია examples/qwen3_8b/-ში. ჩვენ მოვახდინეთ RMSNorm ქერნელის ოპტიმიზაცია H100-ისთვის. ორივე წარმადობის ტესტი ჩატარდა H100 80GB HBM3-ზე BFloat16 სიზუსტით. თუ გსურთ ქერნელის შესწავლა, იხილეთ აქ. კიდევ ერთხელ, ჩვენ შევადარეთ იზოლირებული RMSNorm ქერნელის წარმადობა PyTorch-ის საბაზისო მონაცემებს. საშუალო დაჩქარება: 1.94x და გამტარუნარიანობის ეფექტურობა: H100-ის თეორიული (3,350 GB/წმ) 22.3%. დაჩქარება იზრდება თანმიმდევრობის სიგრძესთან ერთად: 1.58x 128 ტოკენზე, 2.47x 8192 ტოკენზე. გრძელვადიანი დასკვნისთვის, მორგებული ქერნელი დაახლოებით ორჯერ ამცირებს RMSNorm-ის შეყოვნებას. აგენტი გვაწვდის მოქმედ ქერნელს. Kernel Hub საშუალებას გაძლევთ გააზიაროთ ის, რათა ნებისმიერმა შეძლოს მისი ჩატვირთვა კომპილაციის გარეშე. აქ მოცემულია სრული გზა აგენტის გამოსავლიდან გამოქვეყნებულ ქერნელამდე. აგენტი ქმნის პროექტს, რომელიც