გამოვიდა Grok 4.7
xAI-მ გამოუშვა Grok 4.7 — ახალი მოდელი პროგრამირებისთვის, აგენტური სცენარებისთვის და პროფესიული საქმიანობისთვის. Grok 4.6 -თან შედარებით, აქ გაზარდეს საბაზისო მოდელი და საგრძნობლად გაახანგრძლივეს RL-პოსტტრენინგი: სწავლებაში დაამატეს მეტი დავალება, რომლებიც გათვლილია მრავალსაათიან შესრულებაზე,…
xAI-მ გამოუშვა Grok 4.7 — ახალი მოდელი პროგრამირებისთვის, აგენტური სცენარებისთვის და პროფესიული საქმიანობისთვის.
Grok 4.6-თან შედარებით, აქ გაზარდეს საბაზისო მოდელი და საგრძნობლად გაახანგრძლივეს RL-პოსტტრენინგი: სწავლებაში დაამატეს მეტი დავალება, რომლებიც გათვლილია მრავალსაათიან შესრულებაზე, მოდელს კი ცალკე ასწავლეს საკუთარი ნამუშევრის გადამოწმება და კონტექსტის უფრო ხანგრძლივად შენარჩუნება.
რა ხდება ბენჩმარკებში?
- CursorBench 4.0: 46,3% 40,4%-ის წინააღმდეგ;
- DeepSWE v1.1: 71,0% 65,2%-ის წინააღმდეგ;
- Terminal-Bench 4.0: 38,0% 20,3%-ის წინააღმდეგ;
- EEBench: 64,0% 53,0%-ის წინააღმდეგ;
- Harvey Legal Agent Benchmark: 19,6% 15,8%-ის წინააღმდეგ;
- HealthBench Professional: 56,7% 48,5%-ის წინააღმდეგ.
რა შეიცვალა შიგნით
xAI-ს არ გაუმჟღავნებია Grok 4.7-ის პარამეტრების რაოდენობა. ამასთან, ჯერ კიდევ ივლისში ილონ მასკი ამბობდა, რომ შემდეგ ვერსიას 2,1 ტრილიონი პარამეტრი უნდა ჰქონოდა, თუმცა ამ ციფრის სრული დარწმუნებით Grok 4.7-ის სპეციფიკაციაში გადატანა არ შეიძლება.
დადასტურებული ინფორმაციიდან ამჟამად ცნობილია შემდეგი: Grok 4.6-თან შედარებით მოდელს აქვს ახალი, უფრო დიდი საბაზისო backbone, უფრო ხანგრძლივი RL-სწავლება და განსაკუთრებული აქცენტი ამოცანებზე, რომლებიც საათობით მუშაობას მოითხოვს. კონტექსტური ფანჯარა შეადგენს 500 ათას ტოკენს, ხოლო მსჯელობის (reasoning) დონეები ხელმისაწვდომია low-დან xhigh-მდე.
ფასი ამასთანავე Grok 4.6-ის დონეზე დარჩა: $2 ყოველ 1 მილიონ შემავალ ტოკენზე და $6 ყოველ 1 მილიონ გამომავალ ტოკენზე. API-ში უკვე ხელმისაწვდომია grok-4.7; მოდელი ასევე გამოჩნდა Cursor-ში, Grok Build-სა და მესამე მხარის როუტერებში.
გარდა ამისა, xAI-მ განაახლა safeguards სისტემა. კომპანია მას სრულიად ახალს უწოდებს და ამტკიცებს, რომ Grok 4.7-მა აჩვენა საუკეთესო შედეგები მის მიერ გამოცდილ მოდელებს შორის საშიში მოთხოვნების უარყოფისა და jailbreak-ის მიმართ მდგრადობის კუთხით. HackerBench v0.3-ზე მოდელმა გაატარა საშიში ორმაგი დანიშნულების (dual-use) მოთხოვნების 3,3%; ხოლო LatchBio-ზე 62,4% მიიღო.
ვინც უკვე მოასწრო მოდელის შეფასება, რას იტყვით? Grok 4.7-ის გატესტვა უკვე შესაძლებელია BotHub-ზე, ხოლო ამ ბმულით დამატებით 300 ათასი კაფსის მიღებაც შეგიძლიათ. გაგვიზიარეთ შთაბეჭდილებები!

