ხელოვნური ინტელექტი (AI) საძიებო სისტემების ევოლუციის ცენტრშია, რაც მუდმივად აჩენს ახალ კითხვებს ვებ-კონტენტის ოპტიმიზაციასთან დაკავშირებით. ბოლო დროს აქტიურად განიხილება იდეა, რომ დიდი ენობრივი მოდელების (LLM) ქროლერებს [crawlers] ვებ-გვერდების სრული HTML ვერსიების ნაცვლად, გამარტივებული Markdown ფაილები მიეწოდოს.
თუმცა, Google Search Advocate ჯონ მიულერი [John Mueller] მკაცრად აკრიტიკებს ამ მიდგომას, მიიჩნევს რა მას „სულელურ იდეად“ [stupid idea] და სვამს კითხვებს მის ტექნიკურ მიზანშეწონილობასთან დაკავშირებით.
დეველოპერის ექსპერიმენტი: Markdown-ი ტოკენების შესამცირებლად
ერთ-ერთმა დეველოპერმა r/TechSEO-ზე [Reddit] აღწერა თავისი გეგმა, გამოეყენებინა Next.js middleware, რათა ამოეცნო AI მომხმარებლის აგენტები, როგორიცაა GPTBot და ClaudeBot. როდესაც ეს ბოტები გვერდზე მოხვდებოდნენ, middleware მოთხოვნას შეაჩერებდა და მათ სრული React/HTML ფაილის ნაცვლად, უბრალო Markdown ფაილს მიაწვდიდა.
დეველოპერის მტკიცებით, საწყისი ბენჩმარკები [benchmarks] აჩვენებდა ტოკენების [token usage] მოხმარების 95%-იან შემცირებას თითო გვერდზე. მისი არგუმენტით, ამან უნდა გაზარდოს საიტის ინგესტირების [ingestion] შესაძლებლობები Retrieval-Augmented Generation (RAG) ბოტებისთვის.
ჯონ მიულერის ეჭვები და კითხვები
ჯონ მიულერმა ამ იდეას კითხვების სერიით უპასუხა:
- „დარწმუნებული ხართ, რომ მათ შეუძლიათ ვებსაიტზე MD [Markdown] ფაილი ამოიცნონ ტექსტური ფაილის გარდა სხვა რამედ?“
- „შეუძლიათ თუ არა მათ ბმულების გაანალიზება [parse] და მიყოლა?“
- „რა მოუვა თქვენი საიტის შიდა ბმულებს, ჰედერებს [header], ფუტერებს [footer], გვერდითა პანელებს [sidebar] და ნავიგაციას [navigation]?“
- „ერთი საქმეა MD ფაილის ხელით მიცემა, მაგრამ სრულიად განსხვავებულია ტექსტური ფაილის მიწოდება, როდესაც ისინი HTML გვერდს ეძებენ.“
„სულელური იდეა“ – მიულერის პირდაპირი კრიტიკა Bluesky-ზე
Bluesky-ზე [Bluesky] მიულერი უფრო პირდაპირი იყო. SEO კონსულტანტ ჯონო ოლდერსონისთვის [Jono Alderson] საპასუხოდ, რომელიც ამტკიცებდა, რომ გვერდების Markdown-ად გარდაქმნა მათ მნიშვნელობასა და სტრუქტურას აცლის, მიულერმა დაწერა: „გვერდების Markdown-ად გადაქცევა ისეთი სულელური იდეაა. იცოდით, რომ LLM-ებს შეუძლიათ სურათების წაკითხვა? რატომ არ აქცევთ მთელ თქვენს საიტს სურათად?“
ოლდერსონიც ამტკიცებდა, რომ გვერდის Markdown-ად დაყვანა მნიშვნელოვან კონტექსტსა და სტრუქტურას აშორებს და Markdown-ის მოპოვება მოხერხებულობის თამაშად აღწერა და არა გრძელვადიან სტრატეგიად.
საზოგადოების შეშფოთება და დაუდასტურებელი მტკიცებები
Reddit-ის დისკუსიაში სხვა კომენტატორებმაც იგივე შეშფოთება გამოთქვეს. ერთ-ერთმა მომხმარებელმა კითხვის ნიშნის ქვეშ დააყენა, ხომ არ შეზღუდავდა ეს მცდელობა ქროლინგს [crawling] გაუმჯობესების ნაცვლად. მათ აღნიშნეს, რომ არ არსებობს მტკიცებულება, რომ LLM-ები გაწვრთნილი არიან უპირატესობა მიანიჭონ დოკუმენტებს, რომელთა გაანალიზება ნაკლებ რესურსს მოითხოვს.
ორიგინალური პოსტის ავტორი იცავდა თავის თეორიას, ამტკიცებდა რა, რომ LLM-ები უკეთ აანალიზებენ Markdown-ს, ვიდრე HTML-ს, რადგან ისინი ძირითადად კოდის რეპოზიტორებზე [code repositories] არიან გაწვრთნილი. ეს მტკიცება დაუდასტურებელია.
მიულერის თანმიმდევრული პოზიცია და მონაცემები
მიულერი ამ საკითხთან დაკავშირებით თანმიმდევრულია. წინა დისკუსიაში, ლილი რეის [Lily Ray] კითხვაზე LLM-ებისთვის ცალკე Markdown ან JSON გვერდების შექმნის შესახებ, მისი პოზიცია იგივე იყო. მან თქვა, რომ ყურადღება გამახვილდეს სუფთა HTML-სა და სტრუქტურირებულ მონაცემებზე [structured data] და არა მხოლოდ ბოტებისთვის განკუთვნილი კონტენტის ასლების შექმნაზე.
ეს პასუხი მოჰყვა SE Ranking-ის [SE Ranking] ანალიზს 300,000 დომენზე, რომელმაც ვერ იპოვა კავშირი llms.txt ფაილის არსებობასა და იმას შორის, თუ რამდენად ხშირად ხდება დომენის ციტირება LLM-ის პასუხებში. მიულერმა llms.txt შეადარა საკვანძო სიტყვების მეტა ტეგს [keywords meta tag], ფორმატს, რომელიც მთავარმა პლატფორმებმა არ დაადასტურეს, რომ რეიტინგისთვის ან ციტირებისთვის გამოიყენებდნენ.
აქამდე, საჯარო პლატფორმების დოკუმენტაციას არ უჩვენებია, რომ მხოლოდ ბოტებისთვის განკუთვნილი ფორმატები, როგორიცაა გვერდების Markdown ვერსიები, აუმჯობესებს რეიტინგს ან ციტირებას. მიულერმა იგივე წინააღმდეგობები წამოჭრა მრავალ დისკუსიაში, და SE Ranking-ის მონაცემებმა არაფერი აღმოაჩინა საპირისპიროს დასამტკიცებლად.
საუკეთესო პრაქტიკა AI ეპოქაში
სანამ AI პლატფორმა არ გამოაქვეყნებს სპეციფიკაციას [spec], რომელიც ვებ-გვერდების Markdown ვერსიებს მოითხოვს, საუკეთესო პრაქტიკა უცვლელი რჩება: შეინარჩუნეთ სუფთა HTML, შეამცირეთ ზედმეტი JavaScript [JavaScript], რომელიც ბლოკავს კონტენტის გაანალიზებას [parsing], და გამოიყენეთ სტრუქტურირებული მონაცემები [structured data] იქ, სადაც პლატფორმებს დოკუმენტირებული სქემები [schemas] აქვთ.