ხელოვნური ინტელექტის [AI] სწრაფი განვითარება უამრავ ახალ შესაძლებლობას ქმნის, მაგრამ თან მოაქვს გამოწვევებიც, განსაკუთრებით კი შედეგების სანდოობასა და თანმიმდევრულობასთან დაკავშირებით. SparkToro-ს მიერ ჩატარებულმა უახლესმა კვლევამ, რომლის ავტორებიც რენდ ფიშკინი [Rand Fishkin] და პატრიკ ო’დონელი [Patrick O’Donnell] არიან, საკვანძო კითხვები გააჩინა AI-ის რეკომენდაციების არასტაბილურობის შესახებ. კვლევის მიხედვით, AI ინსტრუმენტები, თითქმის ყოველთვის სხვადასხვა ბრენდის რეკომენდაციების სიას წარმოქმნიან, მაშინაც კი, როცა ერთსა და იმავე მოთხოვნას [prompt] იღებენ.
კონკრეტულად, მონაცემებმა აჩვენა, რომ <1%-ზე ნაკლები შანსია იმისა, რომ ChatGPT-მ ან Google-ის AI-მ ძიებაში [AI Overviews/AI Mode] ერთი და იგივე ბრენდების სია დააბრუნონ ერთი და იმავე მოთხოვნის განმეორებით გაშვებისას. ეს აღმოჩენა მნიშვნელოვანია ტექნიკური ენთუზიასტებისთვის, დეველოპერებისა და ბიზნესის წარმომადგენლებისთვის, რომლებიც AI-ზე დაფუძნებულ გადაწყვეტილებებს ეყრდნობიან.
მეთოდოლოგია: როგორ ჩატარდა კვლევა?
კვლევის გუნდმა, SparkToro-ს თანადამფუძნებელ რენდ ფიშკინისა [Rand Fishkin] და AI ტრეკინგის სტარტაპ Gumshoe.ai-ის პატრიკ ო’დონელის [Patrick O’Donnell] ხელმძღვანელობით, ვრცელი ანალიზი ჩაატარა. ნოემბერ-დეკემბერში ასობით მოხალისის მონაწილეობით, 2,961 მოთხოვნა [prompt] გაიშვა ChatGPT-ზე, Claude-სა და Google Search AI Overviews-ზე (როცა AI Overviews არ გამოჩნდა, გამოყენებული იყო AI Mode). ავტორებმა გამოსცადეს 12 მოთხოვნა, რომელიც ბრენდის რეკომენდაციებს ითხოვდა სხვადასხვა კატეგორიაში, მათ შორის: მზარეულის დანები, ყურსასმენები, ონკოლოგიური საავადმყოფოები, ციფრული მარკეტინგის კონსულტანტები და სამეცნიერო ფანტასტიკის რომანები. თითოეული მოთხოვნა 60-100-ჯერ გაიშვა თითოეულ პლატფორმაზე.
კვლევის ძირითადი მიგნებები: არათანმიმდევრულობა
შედეგები გასაოცარი იყო: თითქმის ყველა პასუხი უნიკალური აღმოჩნდა სამი ასპექტით:
- წარმოდგენილი ბრენდების სია;
- რეკომენდაციების თანმიმდევრობა;
- დაბრუნებული ნივთების რაოდენობა.
ფიშკინმა კვლევის მთავარი მიგნება შეაჯამა: „თუ AI ინსტრუმენტს ასჯერ სთხოვთ ბრენდის/პროდუქტის რეკომენდაციებს, თითქმის ყველა პასუხი უნიკალური იქნება.“ აღსანიშნავია, რომ Claude-მა ოდნავ მეტი თანმიმდევრულობა აჩვენა ერთი და იმავე სიის ორჯერ წარმოქმნაში, მაგრამ ნაკლებად სავარაუდო იყო, რომ იგივე თანმიმდევრობა გამოეყენებინა. არცერთი პლატფორმა არ მიუახლოვდა ავტორების მიერ განსაზღვრულ „სანდო განმეორებადობას“.
პრომპტების მრავალფეროვნება და AI-ის თანმიმდევრულობა
კვლევამ ასევე შეისწავლა, თუ როგორ წერენ რეალური მომხმარებლები მოთხოვნებს. როდესაც 142 მონაწილეს სთხოვეს დაეწერათ საკუთარი მოთხოვნები ყურსასმენების შესახებ მოგზაური ოჯახის წევრისთვის, თითქმის არცერთი მოთხოვნა არ ჰგავდა ერთმანეთს. ამ ადამიანის მიერ დაწერილ მოთხოვნებს შორის სემანტიკური მსგავსების ქულა იყო 0.081, რასაც ფიშკინმა „კუნგ პაო ქათამსა და არაქისის კარაქს“ შეადარა. მიუხედავად მოთხოვნების ასეთი მრავალფეროვნებისა, AI ინსტრუმენტებმა მაინც დააბრუნეს ბრენდები შედარებით თანმიმდევრული განხილვის ნაკრებიდან. მაგალითად, Bose, Sony, Sennheiser და Apple გამოჩნდა 994 პასუხის 55-77%-ში ამ მრავალფეროვან ყურსასმენების მოთხოვნებზე.
AI რეიტინგის პოზიციის საკითხი
ეს მიგნებები ეჭვქვეშ აყენებს „AI რეიტინგის პოზიციის“ [AI ranking position] ღირებულებას, როგორც მეტრულ ერთეულს. ფიშკინმა დაწერა: „ნებისმიერი ინსტრუმენტი, რომელიც „რეიტინგის პოზიციას AI-ში“ იძლევა, უაზროა.“ თუმცა, მონაცემები ვარაუდობს, რომ უფრო თანმიმდევრულია ის, თუ რამდენად ხშირად ჩნდება ბრენდი მსგავსი მოთხოვნების მრავალჯერადი გაშვებისას. ვიწრო კატეგორიებში, როგორიცაა ღრუბლოვანი გამოთვლის პროვაიდერები [cloud computing providers], წამყვანი ბრენდები პასუხების უმეტესობაში ჩნდებოდნენ. უფრო ფართო კატეგორიებში, როგორიცაა სამეცნიერო ფანტასტიკის რომანები, შედეგები უფრო გაფანტული იყო.
სხვა კვლევებთან პარალელები
ეს დასკვნები შეესაბამება სხვა მოხსენებებსაც. დეკემბერში, Ahrefs-მა გამოაქვეყნა მონაცემები, რომლებიც აჩვენებდა, რომ Google-ის AI Mode და AI Overviews ერთი და იმავე შეკითხვისთვის 87%-ით განსხვავებულ წყაროებს ასახელებენ. მიუხედავად იმისა, რომ Ahrefs-ის მოხსენება სხვა საკითხზე იყო ფოკუსირებული (ერთი და იგივე პლატფორმა, მაგრამ განსხვავებული ფუნქციებით), SparkToro-ს მონაცემები (ერთი და იმავე პლატფორმა და მოთხოვნა, მაგრამ განსხვავებული გაშვებებით) მსგავს ტენენციას ადასტურებს. ამ კვლევების ზოგადი სურათი ერთი და იმავე მიმართულებით მიგვანიშნებს: AI რეკომენდაციები, როგორც ჩანს, ყველა დონეზე განსხვავდება, მიუხედავად იმისა, პლატფორმებს ადარებთ, პლატფორმაში არსებულ ფუნქციებს, თუ ერთი და იმავე ფუნქციაზე განმეორებით შეკითხვებს.
მნიშვნელოვანი შეკითხვები და სამომავლო ნაბიჯები
კვლევა ჩატარდა Gumshoe.ai-სთან პარტნიორობით, რომელიც AI ტრეკინგის ინსტრუმენტებს ყიდის. ფიშკინმა ეს გაამჟღავნა და აღნიშნა, რომ მისი თავდაპირველი ჰიპოთეზა იყო, რომ AI ტრეკინგი „უაზრო“ იქნებოდა. გუნდმა სრული მეთოდოლოგია და ნედლი მონაცემები საჯარო ვებგვერდზე გამოაქვეყნა. მოხსენება არ არის რეცენზირებული აკადემიური კვლევა, რასაც ფიშკინმა მეთოდოლოგიური შეზღუდვები უწოდა და მოუწოდა უფრო ფართომასშტაბიანი შემდგომი სამუშაოებისკენ. ავტორებმა ღიად დატოვეს კითხვები იმის შესახებ, თუ რამდენი მოთხოვნის გაშვებაა საჭირო სანდო ხილვადობის მონაცემების მისაღებად და იწვევს თუ არა API [API] ზარები იგივე ვარიაციებს, რასაც ხელით შეყვანილი მოთხოვნები.
AI ტრეკინგის ინსტრუმენტების შეფასებისას, მიგნებები გვთავაზობს, რომ პროვაიდერებს მათი მეთოდოლოგიის დემონსტრირება სთხოვოთ. ფიშკინმა დაწერა: „სანამ ერთ ცენტსაც კი დახარჯავთ AI ხილვადობის ტრეკინგზე, დარწმუნდით, რომ თქვენი პროვაიდერი პასუხობს აქ დასმულ კითხვებს და აჩვენებს თავის გამოთვლებს.“