ახალი მეთოდები მოდელებს 4 ბიტზე ნაკლები სიზუსტით ინახავს, თუმცა სიჩქარესა და ენას აზიანებს
Liebling, ich habe die Chatbots geschrumpft
წყარო: heise online. ქართული თარგმანი — შიკრიკი.

ტექსტი ავტომატურად ითარგმნა. წყარო: heise online.
ზოგადად, კვანტიზაციით გამოწვეული ხარისხის დანაკარგი უმეტესად ნაკლებია, ვიდრე უფრო დიდი მოდელის გამოყენებით მიღებული სარგებელი. ამიტომ მოცემულ აპარატურაზე დიდი კვანტიზებული მოდელის გაშვება უფრო გონივრულია, ვიდრე მცირე მოდელის FP16 სიზუსტით გამოყენება. მთავარი შემზღუდავი ფაქტორი მეხსიერებაა. მაგალითად, ვიდეოდაფაზე 12 გიგაბაიტი VRAM-ის შემთხვევაში მომხმარებელი 6B-ზე ნაკლები პარამეტრის მქონე მოდელებით შემოიფარგლება, რადგან FP16 თითო პარამეტრზე 2 ბაიტს მოითხოვს. ამასთან, KV-ქეშისთვისაც საჭიროა ადგილი. ამიტომ რეალურად დაახლოებით 4B მოდელების გამოყენებაა შესაძლებელი. 4-ბიტიანი კვანტიზაციით კი 20B კლასამდე უფრო დიდი მოდელების გაშვება შეიძლება, მაგალითად GPT-OSS 20B-ის ან ახალი AMD Instella 16B A3B-ის.
ახლა კვლავ განიხილავენ კვანტიზაციის მეთოდებს, რომლებიც კიდევ უფრო შორს მიდის და თითო პარამეტრზე 4 ბიტზე ნაკლებს იყენებს. ეს პრინციპულად ახალი არ არის. Microsoft-მა ჯერ კიდევ 2025 წლის აპრილში BitNet b1.58-ით ყურადღება მიიპყრო. ის თითო პარამეტრზე საშუალოდ მხოლოდ 1,58 ბიტს იყენებს. უჩვეულო მაჩვენებელი შერეული გამოთვლიდან მიიღება: ბევრი პარამეტრი მხოლოდ 0-ით ან 1-ით, ანუ ერთი ბიტით ინახება, ზოგი კი 4 ბიტამდე სიზუსტეს იყენებს.
იმ დროსაც ეპოქის ცვლილებაზე საუბრობდნენ. თუმცა აჟიოტაჟი მალევე ჩაცხრა და 4-ბიტიანი კვანტიზაცია სტანდარტად დარჩა. ეს მიდგომა გამოიყენება, მაგალითად, როცა მომხმარებელი ollama-ს ან LM Studio-ს კატალოგიდან მოდელს ჩამოტვირთავს. ახლა სტარტაპი Prism ML (Prism ML) აცხადებს, რომ კვანტიზაციით სამომხმარებლო მოწყობილობებზე გადაიტანს ისეთ 27B მოდელს, როგორიც Qwen 3.6-ია. გავრცელებულ საორიენტაციო ტესტებში მისი ხარისხი თითქმის Nemotron 3 Ultra-ს, 550B მოდელის, დონეს აღწევს. მოდელების ოჯახს Bonsai ეწოდება და მინიმუმ 4 გიგაბაიტი RAM უნდა ეყოს. შესაბამისად, მისი გამოყენება მობილურ ტელეფონებსა და GPU-ს გარეშე კომპიუტერებზეც შესაძლებელი იქნება. ამისთვის საჭიროა llama.cpp-ის მორგებული ვარიანტი. llama.cpp ენის დიდი მოდელებით დასკვნის გამოსატანად გავრცელებული სამუშაო გარემოა. Ubuntu-ზე ჩატარებულ გამოცდაში სტატიის ავტორმა „Ternary“ ვარიანტი გამოიყენა. ის თითო წონაზე საშუალოდ 1,7 ბიტს იყენებს და 7,2 გიგაბაიტს იკავებს, FP16 ფორმატის 54 გიგაბაიტის ნაცვლად. Nvidia RTX 4070 Super-ზე, რომელსაც 12 გიგაბაიტი VRAM აქვს, მოდელმა წამში 50 ტოკენი წარმოქმნა. ეს სრულიად მისაღები შედეგია. წამში 30 ტოკენიდან ინტერაქტიული საუბარი შეფერხების გარეშე აღიქმება, რადგან მომხმარებელი გენერირების სიჩქარეზე სწრაფად ვერ კითხულობს. „Reasoning“ რეჟიმში მოდელი საბოლოო პასუხის მომხმარებლისთვის მიწოდებამდე შიდა მოხმარებისთვის ტოკენებს წარმოქმნის. ამ რეჟიმში მისაღებ მაჩვენებლად წამში 60 ტოკენი დამკვიდრდა. თუ მოდელი 1000 სააზროვნო ტოკენს წარმოქმნის, მომხმარებელი დაახლოებით 17 წამს ელოდება.

Vodafone und Ericsson testen KI-Live-Übersetzung direkt im Mobilfunknetz
პასუხების შინაარსობრივი ხარისხი კარგი იყო, თუმცა გერმანული ენის სისწორე სერიოზულ ეჭვს იწვევდა. ჩინური წარმოშობის მიუხედავად, თავდაპირველ მოდელს გერმანულ მართლწერაში, სიტყვების შერჩევასა და გრამატიკაში პრობლემები არ აქვს. Bonsai 27B კი უჩვეულოდ შეთხზული სიტყვებითა და ორთოგრაფიული შეცდომებით გამოირჩეოდა. მაგალითად, Haustier-ის ნაცვლად მან Haustiherd დაწერა.
სმარტფონზე გამოცდისთვის გამოიყენეს Asus Zenfone 9, რომელსაც 8 გიგაბაიტი RAM აქვს, და აპლიკაცია LLM AI Server with llama.cpp. აპლიკაციაში Hugging Face-ზე მოდელების მოძებნა და ჩამოტვირთვაა შესაძლებელი. მათი გამოყენება პირდაპირ ბრაუზერში, ვებინტერფეისით შეიძლება. აპლიკაცია სიჩქარეს არ ზომავს, თუმცა სუბიექტური შეფასებით, ის დაახლოებით 2 ტოკენი იყო წამში. 27B ვარიანტის 8B ან 4B ვარიანტით შეცვლას შედეგი არსებითად არ შეუცვლია.
მსგავსი მდგომარეობაა ცენტრალურ პროცესორზე მუშაობისას. სწრაფმა Intel Core i7-14700K-მ, რომელსაც 20 ბირთვი და 28 ნაკადი აქვს, წამში მხოლოდ 2-დან 3-მდე ტოკენი წარმოქმნა. ეს პრაქტიკული გამოყენებისთვის საკმარისი არ არის. Colibri-ც „საინტერესო საჩვენებელი ნიმუშის, რომელსაც პრაქტიკული გამოყენება არ აქვს“ კატეგორიას მიეკუთვნება. ენის დიდი მოდელების საკუთარი სამუშაო გარემოს მწარმოებელი აცხადებს, რომ ძლიერ კვანტიზებულ GLM 5.2-ს, რომელსაც 744B პარამეტრი აქვს, GPU-ს გარეშე სამომხმარებლო აპარატურაზე მხოლოდ 32 გიგაბაიტი RAM-ით აამუშავებს. ინტერნეტში გამოქვეყნებული ცნობების მიხედვით, ეს მართლაც მუშაობს. თუმცა სწრაფი SSD-ის შემთხვევაშიც სიჩქარე წამში 0,3 ტოკენია. წინა მაგალითში ნახსენები 1000 სააზროვნო ტოკენის მისაღებად მომხმარებელს თითქმის ერთი საათი უწევს ლოდინი.
შეადარე თარგმანი გამოცემის ორიგინალურ ტექსტს.
გამოქვეყნდა 22 სექტემბერი, 2026

Bürgerrechte ade: Wie die EU-Kommission die Zügel für Europol lockern will

Microsoft löst Probleme nach Software-Updates

AMD beats Intel to the trillion-dollar club as stock price soars — firm joins Nvidia, Broadcom, and SK hynix for companies worth over $1 trillion

Treasury chief says AI bosses, not their bots, will carry the can for criminal acts

GM can’t ‘bring back’ Apple CarPlay because it never left
კომენტარი (0)
გაგვიზიარე შენი აზრი.
კომენტარები ავტომატურად მოწმდება.
აზრის გასაზიარებლად შექმენი ანგარიში ან შედი.
კომენტარები ჯერ არ არის. დაწერე პირველი.