AILINCOM логотипі AILINCOM
Жасанды интеллект шекараларын тексеруге арналған жаңа емтихан құрылды
Мұқаба жасанды интеллект арқылы жасалған
Crius

Crius

2026 ж. 14 нау.
Основная категория
Цифрлық технологиялар және АТ · Жасанды интеллект
Дополнительные
Ғылыми зерттеулер және әзірлемелер · Жасанды интеллект

Жасанды интеллект шекараларын тексеруге арналған жаңа емтихан құрылды

Жасанды интеллект шекараларын тексеруге арналған жаңа емтихан құрылды

Халықаралық сарапшылар тобы жасанды интеллект мүмкіндіктерін объективті бағалау үшін Humanity's Last Exam деп аталатын жаңа емтихан әзірледі. Бұл емтихан қазіргі заманғы модельдер әлі шеше алмайтын тапсырмаларды қамтиды. Алғашқы сынақтар көрсеткендей, тіпті ең озық жасанды интеллект жүйелері де адам деңгейіне жеткен жоқ, ал адам мамандарының тәжірибесі әлі де алмастырылмайды.

CriusЖасанды интеллект шекараларын тексеруге арналған жаңа емтихан құрылды

Жасанды интеллект дәстүрлі академиялық тестілерде жоғары нәтижелер көрсете бастаған сайын, жаңа мәселе туындады: бұрын машиналар үшін күрделі деп саналған сынақтар енді заманауи ЖИ-модельдердің мүмкіндіктерін объективті бағалауға жарамайды. Мысалы, бұрын қиын деп есептелген Massive Multitask Language Understanding (MMLU) емтиханы қазір алдыңғы қатарлы жүйелердің даму деңгейін шынайы көрсете алмайды.

ЖИ үшін жаңа тест әзірлеу

Бұл мәселені шешу үшін Техас A&M университетінің өкілдері де бар, мыңға жуық маманнан құралған халықаралық команда Humanity's Last Exam (HLE) деп аталатын жаңа емтихан түрін жасады. Бұл тест 2500 сұрақтан тұрады, олар математика, гуманитарлық және жаратылыстану ғылымдары, көне тілдер мен арнайы академиялық пәндерді қамтиды. Емтиханға қазіргі ЖИ жүйелері әлі шеше алмайтын тапсырмалар енгізілген. Жоба туралы толық ақпарат Nature журналында және lastexam.ai сайтында жарияланған.

Humanity's Last Exam ерекшеліктері

Сұрақтарды құрастыру мен жетілдіруге түрлі саланың сарапшылары қатысты. Әр сұрақ нақты әрі тексерілетін жауапқа ие болатындай мұқият жасалды және оны интернеттен оңай іздеу арқылы шешу мүмкін болмауы ескерілді. Тапсырмалар тақырыптары көне жазбаларды аудару, құстардың анатомиялық құрылымдарын анықтау және библиялық иврит тілінің айтылу ерекшеліктерін талдауды қамтиды.

Сұрақтарды іріктеу процесі

Әр сұрақ жетекші ЖИ жүйелерінде сыналды. Егер қандай да бір модель сұраққа дұрыс жауап бере алса, ол сұрақ финалдық емтиханнан алынып тасталды. Бұл тәсіл тестті қазіргі ЖИ сенімді шеше алмайтын деңгейде күрделі етуге мүмкіндік берді.

Тестілеу нәтижелері

Алғашқы сынақтар тіпті ең қуатты ЖИ-модельдердің бұл емтиханнан өтуге қиналатынын көрсетті. Мысалы, GPT-4o — 2,7%, Claude 3.5 Sonnet — 4,1%, OpenAI o1 — 8% нәтижеге жетті. Ең дамыған жүйелер — Gemini 3.1 Pro мен Claude Opus 4.6 — 40-50% дәлдік көрсетті.

Жаңа тесттердің қажеттілігі

Бастапқыда адамдарға арналған тестілерде жоғары балл жинау ЖИ-дің шынайы интеллектін көрсете бермейді. Мұндай тестілер көбіне нақты тапсырмаларды орындау қабілетін өлшейді, ал терең түсінікті емес. Дәл бағалау құралдары болмаса, әзірлеушілер мен пайдаланушылар ЖИ жүйелерінің мүмкіндіктерін дұрыс түсінбеуі мүмкін. Бенчмарктер прогресті объективті өлшеу мен тәуекелдерді анықтау үшін қажет.

Тесттің ұзақ мерзімді мақсаты мен құрылымы

Humanity's Last Exam болашақ ЖИ жүйелерін бағалауға арналған тұрақты әрі ашық құрал ретінде ойластырылған. Модельдердің жауаптарды жаттап алуын болдырмау үшін сұрақтардың бір бөлігі ғана жарияланған, ал көпшілігі құпия сақталады.

Халықаралық ынтымақтастық

Жобаға түрлі елдер мен салалардан сарапшылар — компьютерлік ғылым, тарих, физика, лингвистика және медицина мамандары қатысты. Бұл әртүрлілік заманауи ЖИ жүйелерінің осал тұстарын анықтауға және күрделі тапсырмалар жасауда адам сараптамасының маңызын көрсетуге мүмкіндік берді.

Тесттің маңызы

Humanity's Last Exam адамның орнын басуды немесе қауіп төндіруді мақсат етпейді, ол жасанды интеллекттің шекарасын объективті бағалауға арналған құрал. Бұл емтихан технологиялық прогреске қарамастан, ЖИ мен адам интеллекті арасында айтарлықтай алшақтық бар екенін және адам сараптамасы әлі де шешуші рөл атқаратынын көрсетеді.

#жасанды_интеллект#тестілеу#табиғат#бенчмарктер#бағалау#Humanitys_Last_Exam
0 —

Пікірлер (0)

Ыстық

Qnap бейнеөндіріс үшін жаңа NAS құрылғыларын таныстырды

2026 ж. 02 қаз.02.10.26 · 0 реакция

Tesla 30 млрд доллар көлемінде несиелік желілер ашты

2026 ж. 02 қаз.02.10.26 · 0 реакция

Әуе тасымалдары өсіп келеді, бірақ жаңа ережелер нарықты қиындатып отыр

2026 ж. 01 қаз.01.10.26 · 0 реакция
Ұсынылған
Бұлтты есептеу

Qnap бейнеөндіріс үшін жаңа NAS құрылғыларын таныстырды

Qnap бейнеөндіріс міндеттеріне арналған және жоғары жылдамдықтағы деректерді беру үшін USB4 порттарымен жабдықталған үш жаңа NAS жүйесін ұсынды. Бұл құрылғылар әртүрлі қосылу режимдерін қолдайды және үлкен сыйымдылықтағы қатқыл дискілер мен SSD-лерді пайдалануға арналған.

Қаржылық талдау

Tesla 30 млрд доллар көлемінде несиелік желілер ашты

Tesla табыстың төмендеуі мен күрделі шығындардың өсуі аясында ірі инвестицияларды қаржыландыру үшін 30 миллиард долларлық несиелік желілер ашты. Жаңа келісім компанияның бизнеске қысым күшейген жағдайда қаржылық мүмкіндіктерін кеңейтеді.

Көлік логистикасы

Әуе тасымалдары өсіп келеді, бірақ жаңа ережелер нарықты қиындатып отыр

Әуе тасымалдары логистиканың барған сайын маңызды бөлігіне айналуда, әсіресе теңіз тасымалдарының тұрақсыздығы аясында. Алайда, әуе жүкқұжаттарын рәсімдеудің жаңа ережелері нарық қатысушылары үшін қосымша қиындықтар мен тәуекелдер туғызуда.