დღეს ვაცხადებთ სტრატეგიულ პარტნიორობას Hugging Face-სა და Amazon-ს შორის, რათა კომპანიებისთვის გამარტივდეს უახლესი მანქანური სწავლის მოდელების გამოყენება და მოწინავე ბუნებრივი ენის დამუშავების (NLP) ფუნქციების უფრო სწრაფად მიწოდება. ამ პარტნიორობის ფარგლებში, Hugging Face იყენებს Amazon Web Services-ს (AWS), როგორც სასურველ ღრუბლოვან პროვაიდერს, თავისი მომსახურების მომხმარებლებისთვის მიწოდებისთვის. როგორც პირველი ნაბიჯი საერთო მომხმარებლებისთვის შესაძლებლობების გასაზრდელად, Hugging Face და Amazon წარმოადგენენ Hugging Face-ის ახალ ღრმა სწავლის კონტეინერებს (DLCs), რათა Amazon SageMaker-ში Hugging Face Transformer მოდელების გაწვრთნა მარტივი გახდეს, როგორც არასდროს. იმის გასაგებად, თუ როგორ გამოიყენოთ Hugging Face-ის ახალი DLC-ები Amazon SageMaker Python SDK-თან ერთად, იხილეთ ქვემოთ მოცემული სახელმძღვანელოები და რესურსები. 2021 წლის 8 ივლისს, ჩვენ გავაფართოვეთ Amazon SageMaker-ის ინტეგრაცია Transformers მოდელების მარტივი განლაგებისა და ინფერენციის დასამატებლად. თუ გსურთ გაიგოთ, როგორ შეგიძლიათ მარტივად განათავსოთ Hugging Face მოდელები Amazon SageMaker-ის საშუალებით, გადახედეთ ახალ ბლოგ პოსტს და დოკუმენტაციას. Amazon SageMaker-ში ხელმისაწვდომი Hugging Face-ის ახალი ღრმა სწავლის კონტეინერებით, მოწინავე Transformers-ზე დაფუძნებული NLP მოდელების გაწვრთნა არასდროს ყოფილა ასეთი მარტივი. არსებობს ვარიანტები, რომლებიც სპეციალურად ოპტიმიზებულია TensorFlow-ისა და PyTorch-ისთვის, ერთ-GPU-იან, ერთ-კვანძიან მრავალ-GPU-იან და მრავალ-კვანძიან კლასტერებისთვის. Hugging Face-ის DLC-ების გარდა, ჩვენ შევქმენით უმაღლესი დონის Hugging Face-ის გაფართოება SageMaker Python-sdk-ისთვის, რათა დავაჩქაროთ მონაცემთა მეცნიერების გუნდები, შევამციროთ ექსპერიმენტების დაყენებისა და გაშვებისთვის საჭირო დრო დღეებიდან წუთებამდე. თქვენ შეგიძლიათ გამოიყენოთ Hugging Face-ის DLC-ები Amazon SageMaker-ის ავტომატური მოდელის დარეგულირების (Automatic Model Tuning) შესაძლებლობით, რათა ავტომატურად მოახდინოთ თქვენი გაწვრთნის ჰიპერპარამეტრების ოპტიმიზაცია და სწრაფად გაზარდოთ თქვენი მოდელების სიზუსტე. SageMaker Studio-ის ვებ-დაფუძნებული ინტეგრირებული განვითარების გარემოს (IDE) წყალობით, შეგიძლიათ მარტივად აკონტროლოთ და შეადაროთ თქვენი ექსპერიმენტები და გაწვრთნის არტეფაქტები. Hugging Face-ის DLC-ებით, SageMaker-ის მომხმარებლები ისარგებლებენ PyTorch-ის ან TensorFlow-ისთვის ჩაშენებული მუშაობის ოპტიმიზაციებით, NLP მოდელების უფრო სწრაფად გასაწვრთნელად, და მოქნილობით, რათა აირჩიონ გაწვრთნის ინფრასტრუქტურა საუკეთესო ფასი/ეფექტურობის თანაფარდობით მათი სამუშაო დატვირთვისთვის. Hugging Face-ის DLC-ები სრულად არის ინტეგრირებული SageMaker-ის განაწილებული გაწვრთნის ბიბლიოთეკებთან, რათა მოდელები გაწვრთნან იმაზე სწრაფად, ვიდრე ოდესმე იყო შესაძლებელი, Amazon EC2-ზე ხელმისაწვდომი ინსტანსების უახლესი თაობის გამოყენებით. ქვემოთ შეგიძლიათ იპოვოთ ყველა მნიშვნელოვანი რესურსი გამოქვეყნებულ ბლოგ პოსტებზე, ვიდეოებზე, დოკუმენტაციაზე და ნიმუშ Notebook-ებსა თუ სკრიპტებზე. ამ დაწყების სახელმძღვანელოში, ჩვენ გამოვიყენებთ Hugging Face-ის ახალ DLC-ებს და Amazon SageMaker-ის გაფართოებას ტრანსფორმერ მოდელის გასაწვრთნელად ბინარული ტექსტის კლასიფიკაციაზე transformers და datasets ბიბლიოთეკების გამოყენებით. მაგალითისთვის ჩვენ გამოვიყენებთ Amazon SageMaker Notebook Instance-ს. აქ შეგიძლიათ გაიგოთ, როგორ დააყენოთ Notebook Instance. რას ვაპირებთ: როგორც ზემოთ აღინიშნა, ამისთვის გამოვიყენებთ SageMaker Notebook Instances-ს. დასაწყებად, თქვენ უნდა შეხვიდეთ თქვენს Jupyter Notebook-ში ან JupyterLab-ში და შექმნათ ახალი ნოუთბუქი conda_pytorch_p36 ბირთვით. შენიშვნა: Jupyter-ის გამოყენება სურვილისამებრ არის: ჩვენ ასევე შეგვეძლო SageMaker-ის გაწვრთნის ამოცანების გაშვება ნებისმიერი ადგილიდან, სადაც გვაქვს SDK დაყენებული, ღრუბელთან კავშირი და შესაბამისი ნებართვები, როგორიცაა ლეპტოპი, სხვა IDE ან დავალების დამგეგმავი, როგორიცაა Airflow ან AWS Step Functions. ამის შემდეგ შეგვიძლია დავაყენოთ საჭირო დამოკიდებულებები. SageMaker-ზე გაწვრთნის გასაშვებად, უნდა შევქმნათ sagemaker Session და მივცეთ IAM როლი სწორი ნებართვით. ეს IAM როლი მოგვიანებით დაერთვება TrainingJob-ს, რაც მას საშუალებას მისცემს ჩამოტვირთოს მონაცემები, მაგალითად, Amazon S3-დან. SageMaker TrainingJob-ში ჩვენ ვასრულებთ Python სკრიპტს დასახელებული არგუმენტებით. ამ მაგალითში ვიყენებთ PyTorch-ს transformers-თან ერთად. სკრიპტი გამოიყენებს datasets ბიბლიოთეკას ჩვენი imdb მონაცემთა ნაკრების ჩამოსატვირთად და წინასწარი დამუშავებისთვის. წინასწარი დამუშავების შემდეგ, მონაცემთა ნაკრები აიტვირთება მიმდინარე სესიის ნაგულისხმევ S3 bucket-ში (sess.default_bucket()), რომელიც გამოყენებული იქნება ჩვენს გაწვრთნის ამოცანაში. IMDb მონაცემთა ნაკრები შედგება 25000 გაწვრთნის და 25000 ტესტირების მაღალპოლარული ფილმის მიმოხილვისგან. SageMaker TrainingJob-ის შესაქმნელად შეგვიძლია გამოვიყენოთ HuggingFace Estimator. Estimator მართავს Amazon SageMaker-ის ბოლო-ბოლო გაწვრთნას. Estimator-ში ჩვენ განვსაზღვრავთ, რომელი fine-tuning სკრიპტი უნდა იყოს გამოყენებული, როგორც entry_point, რომელი instance_type უნდა იყოს გამოყენებული, რომელი ჰიპერპარამეტრები გადაეცემა. გარდა ამისა, ხელმისაწვდომია არაერთი მოწინავე კონტროლი, როგორიცაა გამომავალი და checkpointing ლოკაციების მორგება, ლოკალური შენახვის ზომის ან ქსელის კონფიგურაციის მითითება. SageMaker ზრუნავს ჩვენთვის საჭირო Amazon EC2 ინსტანსების დაწყებასა და მართვაზე Hugging Face DLC-ით, ის ტვირთავს მოწოდებულ fine-tuning სკრიპტს, მაგალითად, ჩვენს train.py-ს, შემდეგ ჩამოტვირთავს მონაცემებს S3 bucket-დან, sess.default_bucket()-დან, კონტეინერში. როგორც კი მონაცემები მზად იქნება, გაწვრთნის ამოცანა ავტომატურად დაიწყება გაშვებით. ჰიპერპარამეტრები, რომლებსაც თქვენ განსაზღვრავთ HuggingFace Estimator-ში, გადაეცემა დასახელებული არგუმენტების სახით.