Жасанды интеллект шекараларын тексеруге арналған жаңа емтихан құрылды
Халықаралық сарапшылар тобы жасанды интеллект мүмкіндіктерін объективті бағалау үшін Humanity's Last Exam деп аталатын жаңа емтихан әзірледі. Бұл емтихан қазіргі заманғы модельдер әлі шеше алмайтын тапсырмаларды қамтиды. Алғашқы сынақтар көрсеткендей, тіпті ең озық жасанды интеллект жүйелері де адам деңгейіне жеткен жоқ, ал адам мамандарының тәжірибесі әлі де алмастырылмайды.
Crius
Жасанды интеллект дәстүрлі академиялық тестілерде жоғары нәтижелер көрсете бастаған сайын, жаңа мәселе туындады: бұрын машиналар үшін күрделі деп саналған сынақтар енді заманауи ЖИ-модельдердің мүмкіндіктерін объективті бағалауға жарамайды. Мысалы, бұрын қиын деп есептелген Massive Multitask Language Understanding (MMLU) емтиханы қазір алдыңғы қатарлы жүйелердің даму деңгейін шынайы көрсете алмайды.
ЖИ үшін жаңа тест әзірлеу
Бұл мәселені шешу үшін Техас A&M университетінің өкілдері де бар, мыңға жуық маманнан құралған халықаралық команда Humanity's Last Exam (HLE) деп аталатын жаңа емтихан түрін жасады. Бұл тест 2500 сұрақтан тұрады, олар математика, гуманитарлық және жаратылыстану ғылымдары, көне тілдер мен арнайы академиялық пәндерді қамтиды. Емтиханға қазіргі ЖИ жүйелері әлі шеше алмайтын тапсырмалар енгізілген. Жоба туралы толық ақпарат Nature журналында және lastexam.ai сайтында жарияланған.
Humanity's Last Exam ерекшеліктері
Сұрақтарды құрастыру мен жетілдіруге түрлі саланың сарапшылары қатысты. Әр сұрақ нақты әрі тексерілетін жауапқа ие болатындай мұқият жасалды және оны интернеттен оңай іздеу арқылы шешу мүмкін болмауы ескерілді. Тапсырмалар тақырыптары көне жазбаларды аудару, құстардың анатомиялық құрылымдарын анықтау және библиялық иврит тілінің айтылу ерекшеліктерін талдауды қамтиды.
Сұрақтарды іріктеу процесі
Әр сұрақ жетекші ЖИ жүйелерінде сыналды. Егер қандай да бір модель сұраққа дұрыс жауап бере алса, ол сұрақ финалдық емтиханнан алынып тасталды. Бұл тәсіл тестті қазіргі ЖИ сенімді шеше алмайтын деңгейде күрделі етуге мүмкіндік берді.
Тестілеу нәтижелері
Алғашқы сынақтар тіпті ең қуатты ЖИ-модельдердің бұл емтиханнан өтуге қиналатынын көрсетті. Мысалы, GPT-4o — 2,7%, Claude 3.5 Sonnet — 4,1%, OpenAI o1 — 8% нәтижеге жетті. Ең дамыған жүйелер — Gemini 3.1 Pro мен Claude Opus 4.6 — 40-50% дәлдік көрсетті.
Жаңа тесттердің қажеттілігі
Бастапқыда адамдарға арналған тестілерде жоғары балл жинау ЖИ-дің шынайы интеллектін көрсете бермейді. Мұндай тестілер көбіне нақты тапсырмаларды орындау қабілетін өлшейді, ал терең түсінікті емес. Дәл бағалау құралдары болмаса, әзірлеушілер мен пайдаланушылар ЖИ жүйелерінің мүмкіндіктерін дұрыс түсінбеуі мүмкін. Бенчмарктер прогресті объективті өлшеу мен тәуекелдерді анықтау үшін қажет.
Тесттің ұзақ мерзімді мақсаты мен құрылымы
Humanity's Last Exam болашақ ЖИ жүйелерін бағалауға арналған тұрақты әрі ашық құрал ретінде ойластырылған. Модельдердің жауаптарды жаттап алуын болдырмау үшін сұрақтардың бір бөлігі ғана жарияланған, ал көпшілігі құпия сақталады.
Халықаралық ынтымақтастық
Жобаға түрлі елдер мен салалардан сарапшылар — компьютерлік ғылым, тарих, физика, лингвистика және медицина мамандары қатысты. Бұл әртүрлілік заманауи ЖИ жүйелерінің осал тұстарын анықтауға және күрделі тапсырмалар жасауда адам сараптамасының маңызын көрсетуге мүмкіндік берді.
Тесттің маңызы
Humanity's Last Exam адамның орнын басуды немесе қауіп төндіруді мақсат етпейді, ол жасанды интеллекттің шекарасын объективті бағалауға арналған құрал. Бұл емтихан технологиялық прогреске қарамастан, ЖИ мен адам интеллекті арасында айтарлықтай алшақтық бар екенін және адам сараптамасы әлі де шешуші рөл атқаратынын көрсетеді.
