763 მილიარდი პარამეტრის მოდელს მომსახურებისთვის მოსალოდნელზე ნაკლები GPU მეხსიერება სჭირდება
DeepSeek's new model sets a template for powerful LLMs that run lean
ეს ამბავი გამოაქვეყნა The Register-მა. შიკრიკი მას ქართულად თარგმნის.

ტექსტი ავტომატურად ითარგმნა. ორიგინალი გამოაქვეყნა The Register-მა.
ჩინურმა ხელოვნური ინტელექტის კომპანიამ DeepSeek-მა ხუთშაბათს Flash მოდელის განახლებული ვერსია წარადგინა. ხარჯისა და დაყოვნების შესამცირებლად გამიზნული 4.1 ვერსია მნიშვნელოვან არქიტექტურულ გაუმჯობესებებს მოიცავს. ცვლილებებმა შესაძლოა გზა გაუხსნას უფრო დიდ, ჭკვიან და ნაკლებად რესურსტევად მოდელებს.
763 მილიარდი პარამეტრის მქონე განახლება წინამორბედზე 2,5-ჯერ უფრო დიდია. ის V3-სა და R1-ზე დიდიცაა, რომლებმაც DeepSeek-ს 2025 წლის დასაწყისში გაუთქვეს სახელი.
პარამეტრების უზარმაზარი რაოდენობის მიუხედავად, DeepSeek V4.1 Flash-ს მისი ზომისთვის მოსალოდნელზე გაცილებით ნაკლები მეხსიერება სჭირდება. დეველოპერებმა არქიტექტურული ცვლილებებით მოდელი გააუმჯობესეს და მისი მომსახურებისთვის საჭირო რესურსები მკვეთრად შეამცირეს.
DeepSeek-მა ამას ორი ძირითადი გაუმჯობესებით მიაღწია. პირველია ცვლილებები გასაღები-მნიშვნელობის, ანუ KV, ქეშებში, რომლებიც რამდენიმე სესიის განმავლობაში მოდელის მდგომარეობას აკონტროლებს. ასეთი ქეშები, განსაკუთრებით ჩატბოტების მსგავს მაღალი გამტარუნარიანობის სისტემებში, დიდ მეხსიერებას მოიხმარს.
ყურადღების სხვადასხვა მექანიზმის განახლებამ და ახალი მიზეზობრივი ენკოდერ-დეკოდერის, CED-ის, დანერგვამ მოთხოვნების დამუშავება დააჩქარა. ამასთან, KV ქეშის მოხმარება DeepSeek V4 Flash-ის მოთხოვნების 13%-25%-მდე შემცირდა. იმავე მოცულობის KV ქეშით V4.1 ოთხჯერიდან რვაჯერამდე მეტ მომხმარებელს მოემსახურება.
DeepSeek-ის ტექნიკური ანგარიში ცვლილებებს უფრო დაწვრილებით აღწერს. თუმცა ყველაზე საინტერესო სიახლე განსხვავებული ტიპის მოდელის წონებია.
763 მილიარდი პარამეტრიდან 196 მილიარდი N-გრამის პარამეტრია. ისინი ქმნის სისტემას, რომელსაც დეველოპერები „პირობითი მეხსიერების მოდულს“ უწოდებენ. მეხსიერებისა და გამოთვლების განცალკევებით DeepSeek-ს მოდელების გაუმჯობესება და მომსახურებისთვის საჭირო რესურსების შემცირება შეუძლია.
ეს მოდული მრავალი ნიშნით Google-ის Gemma გუნდის მიერ შექმნილ ფენობრივ ჩაშენებათა, PLE-ის, ტექნოლოგიას ჰგავს. PLE-ის მიზანი საკმარისად ჭკვიანი დიდი ენობრივი მოდელების შეზღუდული გამტარუნარიანობის, მეხსიერებისა და გამოთვლითი სიმძლავრის მქონე მოწყობილობებზე, მაგალითად სმარტფონებზე, გაშვებაა.
DeepSeek-მა იანვარში გამოქვეყნებულ კვლევაში PLE-ის ჩაშენებები N-გრამებით შეცვალა. N-გრამი ტოკენების ჯგუფია: სამგრამი სამი მიმდევრული ტოკენია, ხოლო ორგრამი ორი. პრინციპი სიტყვებისა და ფრაზების ასოციაციას ჰგავს.
მაგალითად, მართკუთხა სამკუთხედზე დასმულმა კითხვამ შესაძლოა მაშინვე გამოიწვიოს ასოციაცია პითაგორას თეორემასთან, ფორმულასთან „A² + B² = C²“ ან გვერდების ჯამით პერიმეტრის გამოთვლასთან.
სხვა გამოცემების ახალი ამბები ამავე მიმართულებიდან.
ამავე გამოცემის სხვა ახალი ამბები: ქართულად, წყაროს კვალით.

More JFrog Artifactory bugs under attack, and all 3 have patches
DeepSeek V4.1 Flash-ში N-გრამის წონები მსგავს როლს ასრულებს. ისინი ფარული ცოდნის ან დამკვიდრებული მეხსიერების წყაროა. ტრადიციული დიდი ენობრივი მოდელები პასუხისთვის ტოკენების ყველაზე სავარაუდო კომბინაციას ითვლის. N-გრამის წონები ამას იაფი ძიებით შესაბამისი ინფორმაციის სწრაფად მოძიებით ავსებს.
სინამდვილეში, მოდელი მოთხოვნის ნაცვლად ჰეშების მიმდევრობას ეძებს. ეს რიცხვები მოთხოვნის ცალკეულ ნაწილებს წარმოადგენს. საძიებო ცხრილშიც მზა პასუხები არ ინახება. იქ ვექტორებად წოდებული მათემატიკური გამოსახულებებია, რომლებიც ლოგიკური დასკვნის გამოტანის პროცესში გადადის.
შედეგად, მოდელს დამატებით პარამეტრებთან ჩვეულებრივ დაკავშირებული წარმადობის დანაკარგის გარეშე უფრო ჭკვიანი და ნიუანსური პასუხების გაცემა შეუძლია.
მოდელის ზომასა და შესაძლებლობებს შორის კავშირი კარგადაა ცნობილი. DeepSeek-ის N-გრამის პარამეტრების მთავარი თავისებურება მონაცემებზე წვდომის მეთოდია.
თანამედროვე დიდი ენობრივი მოდელები დეკოდირებისას, როგორც წესი, ავტორეგრესიულია. ჩატბოტის ან აგენტის მიერ თითოეული ტოკენის გენერირებისას მოდელის ყველა აქტიური წონა მეხსიერებიდან უნდა წაიკითხოს. ამიტომ შემზღუდველი ფაქტორი გამტარუნარიანობაა.
ექსპერტების ნარევის მოდელებმა და უკიდურესად დაბალი სიზუსტის მცოცავმძიმიანმა მონაცემთა ტიპებმა ეს შემაფერხებელი რგოლი შეამცირა. თუმცა DeepSeek V4.1 Flash-ის N-გრამის წონები სხვაგვარად მუშაობს. ისინი ლოგიკური დასკვნის გამოტანისას ხელმისაწვდომ პარამეტრებს მეხსიერებაზე დატვირთვის თანაზომიერი ზრდის გარეშე ეფექტიანად ზრდის.
N-გრამის წონები უზარმაზარი საძიებო ცხრილებია. მათი გამოკითხვა სწრაფი და იაფია, რადგან თითოეული ტოკენის გენერირებისას მათი მთლიანად წაკითხვა საჭირო არ არის. თითო ტოკენზე მხოლოდ რამდენიმე ათეული ცხრილური ძიება სრულდება.
შესაბამისად, წარმადობის შესანარჩუნებლად ამ წონების GPU მეხსიერებაში მოთავსება აუცილებელი არ არის. მათი გადატანა სისტემურ ოპერატიულ მეხსიერებაში ან, შესაძლოა, საკმარისად სწრაფ საცავშიც შეიძლება.
FP8 ფორმატში DeepSeek V4.1 Flash-ის წონების შესანახად ჩვეულებრივ, სულ მცირე, 763 GB GPU მეხსიერება იქნებოდა საჭირო. N-გრამის წონების იაფ სისტემურ მეხსიერებაში გადატანით დაახლოებით 567 GB GPU მეხსიერებაც საკმარისია.
ეს მხოლოდ მინიმუმია. საწარმოო გარემოში მოთხოვნა მნიშვნელოვნად გაიზრდება, რადგან გასათვალისწინებელია KV ქეშებიც. მათი ზომა კონტექსტის სიგრძესა და ერთდროული მომხმარებლების რაოდენობასთან ერთად იზრდება.
ლოგიკური დასკვნის გამოტანისას N-გრამის წონები მოთხოვნის დასამუშავებლად გამოყენებულ რვა მილიარდ აქტიურ პარამეტრს ავსებს. თეორიულად, ეს შედეგის სიზუსტესა და ხარისხს ზრდის. თუმცა ისინი აქტიური პარამეტრების რაოდენობას არ ზრდის. მათი ფუნქცია მეტად ჰგავს სპეციალიზებულ ენციკლოპედიას, რომელიც მოთხოვნის დამუშავებისას შესაბამის გვერდებს თითქმის მყისიერად შლის.
DeepSeek-ის ახალ მოდელს N-გრამის პარამეტრების ერთ-ერთი უდიდესი მარაგი აქვს, თუმცა ამ მიდგომაზე მხოლოდ ის არ მუშაობს. Google-იც PLE-ის საშუალებით ნაკლებად მგრძნობიარე წონებს ადგილობრივ საცავში გადააქვს. ამ დროისთვის ტექნოლოგია მხოლოდ პატარა მოდელებზე გამოიყენეს, რამდენადაც საჯაროდ ცნობილია.
გასული თვის ბოლოს Alibaba-მ ექსპერიმენტული Qwen 3.8-Flash-Next წარადგინა. 180 მილიარდი პარამეტრის მოდელში 51 მილიარდი N-გრამის პარამეტრია. მისი დანერგვა იანვარში DeepSeek-ის გუნდის მიერ გამოქვეყნებული კვლევის მეთოდებს იყენებს.
Alibaba-ს ცნობით, Qwen 3.8-Flash-Next-ის არქიტექტურა მომავალი Qwen 4 მოდელების საფუძველი გახდება. შესაბამისად, N-გრამების შესახებ კიდევ ბევრჯერ გავიგებთ.
შეადარე თარგმანი ორიგინალს, ნახე გამოცემის სრული კონტექსტი და პირველადი მასალა.
გამოქვეყნდა 12 სექტემბერი, 2026

Mars astronauts could live in houses made of yeast and jello, say scientists

EU's Cyber Resilience Act starts the 24-hour vulnerability clock
სხვა გამოცემების ახალი ამბები ამავე მიმართულებიდან.

Lawyer fined $5K over AI-hallucinated witnesses in a murder case

China-modified Nvidia RTX 5090 with massive 96GB of memory appears on Alibaba for less than $4,000 — 3x more VRAM at 65% the cost of the original

Is Patagonia the new data center hub? + Harley-Davidson's role in the trade war
კომენტარი (0)
კომენტარები აზრის გასაზიარებლადაა; მათი მდგომარეობა და მოდერაციის კვალი ყოველთვის ჩანს.
კომენტარები ავტომატურად მოწმდება. მომლოდინე და დამალული მდგომარეობები მკაფიოდ არის აღნიშნული.
კომენტარისთვის საჭიროა შესვლა. ანგარიშით შეგიძლიათ კომენტარის დაწერა, ამბების შენახვა და გამოცემების გამოწერა.
კომენტარები ჯერ არ არის. დაწერე პირველი.