Grok 4.7 vừa đứng #1 trên Harvey LAB-AA v1.1
vượt qua Claude Opus 5.5, GPT-6 Astra, Muse Spark 1.3 và nhiều mô hình khác trên bảng xếp hạng
Bài đánh giá này cực kỳ khắc nghiệt: chỉ cần một ảo giác nghiêm trọng là toàn bộ nhiệm vụ bị chấm 0 điểm
Đây không chỉ là chuyện trả lời đúng... mà còn là hoàn thành chính xác toàn bộ nhiệm vụ mà không mắc phải ảo giác nghiêm trọng nào
Grok 4.7 đang trở thành một cỗ máy suy luận đáng gờm trong những tình huống có hệ quả lớn
vượt qua Claude Opus 5.5, GPT-6 Astra, Muse Spark 1.3 và nhiều mô hình khác trên bảng xếp hạng
Bài đánh giá này cực kỳ khắc nghiệt: chỉ cần một ảo giác nghiêm trọng là toàn bộ nhiệm vụ bị chấm 0 điểm
Đây không chỉ là chuyện trả lời đúng... mà còn là hoàn thành chính xác toàn bộ nhiệm vụ mà không mắc phải ảo giác nghiêm trọng nào
Grok 4.7 đang trở thành một cỗ máy suy luận đáng gờm trong những tình huống có hệ quả lớn