როდესაც AI ინფრასტრუქტურის ხარჯებზე ვსაუბრობთ, აქცენტი, როგორც წესი, Nvidia-სა და GPU-ებზე კეთდება – თუმცა მეხსიერება სურათის სულ უფრო მნიშვნელოვანი ნაწილი ხდება. მაშინ, როცა ჰიპერსკალერები მილიარდობით დოლარის ღირებულების ახალი მონაცემთა ცენტრების მშენებლობისთვის ემზადებიან, DRAM ჩიპების ფასი ბოლო წელს დაახლოებით 7-ჯერ გაიზარდა. ამავდროულად, იზრდება დისციპლინა ამ მეხსიერების ორკესტრირების კუთხით, რათა უზრუნველყოფილი იყოს სწორი მონაცემების მიწოდება სწორ აგენტთან საჭირო დროს. კომპანიები, რომლებიც ამ სფეროს დაეუფლებიან, შეძლებენ იგივე მოთხოვნების გაკეთებას ნაკლები ტოკენით, რაც შეიძლება იყოს გადამწყვეტი ბიზნესის შენარჩუნებისთვის. ნახევარგამტარების ანალიტიკოსი დაგ ო’ლაჰლინი თავის Substack-ზე საინტერესოდ განიხილავს მეხსიერების ჩიპების მნიშვნელობას, სადაც ის ესაუბრება ვალ ბერკოვიჩს, Weka-ს AI დირექტორს. ორივე მათგანი ნახევარგამტარების სპეციალისტია, ამიტომ აქცენტი უფრო მეტად ჩიპებზე კეთდება, ვიდრე უფრო ფართო არქიტექტურაზე; AI პროგრამული უზრუნველყოფისთვის შედეგებიც საკმაოდ მნიშვნელოვანია. განსაკუთრებით შთამბეჭდავი იყო ეს პასაჟი, სადაც ბერკოვიჩი განიხილავს Anthropic-ის პრომპტის ქეშირების დოკუმენტაციის მზარდ სირთულეს: ეს ჩანს, თუ გადავხედავთ Anthropic-ის პრომპტის ქეშირების ფასების გვერდს. ექვსი-შვიდი თვის წინ ეს იყო ძალიან მარტივი გვერდი, განსაკუთრებით Claude Code-ის გაშვებისას — უბრალოდ „გამოიყენეთ ქეშირება, ეს უფრო იაფია.“ ახლა ეს არის რჩევების ენციკლოპედია იმის შესახებ, თუ რამდენი ქეშის ჩაწერა უნდა შეიძინოთ წინასწარ. არსებობს 5-წუთიანი დონეები, რაც ინდუსტრიაში ძალიან გავრცელებულია, ან 1-საათიანი დონეები — და არაფერი ამაზე მეტი. ეს ნამდვილად მნიშვნელოვანი ნიშანია. შემდეგ, რა თქმა უნდა, არსებობს არბიტრაჟის ყველა სახის შესაძლებლობა ქეშის წაკითხვის ფასების გარშემო, იმის მიხედვით, თუ რამდენი ქეშის ჩაწერა გაქვთ წინასწარ შეძენილი. აქ კითხვა არის, რამდენ ხანს ინახავს Claude თქვენს პრომპტს ქეშირებულ მეხსიერებაში: შეგიძლიათ გადაიხადოთ 5-წუთიანი ფანჯრისთვის, ან მეტი გადაიხადოთ ერთსაათიანი ფანჯრისთვის. ბევრად იაფია იმ მონაცემების გამოყენება, რომლებიც ჯერ კიდევ ქეშშია, ასე რომ, თუ სწორად მართავთ, შეგიძლიათ ბევრი დაზოგოთ. თუმცა, არსებობს ერთი ნიუანსი: ყოველი ახალი მონაცემი, რომელსაც მოთხოვნას დაამატებთ, შესაძლოა სხვა რამ ამოაგდოს ქეშის ფანჯრიდან. ეს რთული საკითხია, მაგრამ შედეგი საკმაოდ მარტივია: მეხსიერების მართვა AI მოდელებში AI-ის მომავლის უდიდესი ნაწილი იქნება. კომპანიები, რომლებიც ამას კარგად გააკეთებენ, წინა პლანზე გამოვლენ. და ამ ახალ სფეროში ჯერ კიდევ ბევრია გასაკეთებელი. ოქტომბერში მე დავწერე სტარტაპ TensorMesh-ის შესახებ, რომელიც მუშაობდა სტეკის ერთ ფენაზე, რომელიც ცნობილია როგორც ქეშის ოპტიმიზაცია. შესაძლებლობები არსებობს სტეკის სხვა ნაწილებშიც. მაგალითად, სტეკის ქვედა დონეზე, არის კითხვა, თუ როგორ იყენებენ მონაცემთა ცენტრები მათ მიერ არსებული მეხსიერების სხვადასხვა ტიპებს. (ინტერვიუში საინტერესოდ განიხილება, როდის გამოიყენება DRAM ჩიპები HBM-ის ნაცვლად, თუმცა ეს საკმაოდ სიღრმისეული აპარატურული დეტალია.) სტეკის უფრო მაღალ დონეზე, საბოლოო მომხმარებლები არკვევენ, თუ როგორ მოაწყონ თავიანთი მოდელების ნაკრები, რათა გამოიყენონ საერთო ქეში. რაც უფრო უკეთესი გახდებიან კომპანიები მეხსიერების ორკესტრირებაში, ისინი ნაკლებ ტოკენს გამოიყენებენ და ინფერენცია გაიაფდება. ამასობაში, მოდელები უფრო ეფექტური ხდებიან თითოეული ტოკენის დამუშავებაში, რაც კიდევ უფრო ამცირებს ხარჯებს. სერვერის ხარჯების შემცირებისას, მრავალი აპლიკაცია, რომლებიც ახლა სიცოცხლისუნარიანი არ ჩანს, მომგებიანი გახდება.