Қолданбалардағы осалдықтарды анықтаудағы жасанды интеллект модельдерін салыстыру
Қолданбалардағы осалдықтарды іздеу бойынша практикалық тестте заманауи ЖИ-модельдер тиімділік пен шешімдердің құны жағынан айтарлықтай айырмашылық көрсетті. GPT-5.5 ең нәтижелі болып шықса, DeepSeek V4 Pro ең үнемді шешім болды, бұл киберқауіпсіздік құралдарын ауқымды түрде енгізу кезінде маңызды.
Crius
Заманауи жасанды интеллект модельдерінің киберқауіпсіздік саласындағы мүмкіндіктерін зерттеу
Соңғы жылдағы ең айқын тесттердің бірі барысында әртүрлі ЖИ-модельдердің қосымшалардағы осалдықтарды анықтау қабілеті тексерілді. Эксперимент үшін арнайы кітап шолуларына арналған қосымша әзірленіп, оған әдейі осалдық енгізілді: APK-файлда ашық күйде сақталған Firebase тіркелгі деректері болды, бұл деректер базасына қорғалған API-ды айналып өтіп, тікелей қол жеткізуге мүмкіндік берді. Оннан астам ЖИ-модельге осы осалдықты анықтау және пайдалану тапсырмасы берілді, әрқайсысына $10 бюджет және екі сағат уақыт лимиті белгіленді. Эксперименттің жалпы шығыны $1 500 құрады.
ЖИ-модельдерді тестілеу нәтижелері
GPT-5.5 ең жоғары тиімділікті көрсетті — 10 әрекеттің 7-інде тапсырманы сәтті орындап, бір сәтті нәтиженің орташа құны $9,46 болды. Көп жағдайда модель APK-ны талдағаннан кейін бірден Firebase осалдығына назар аударып, қосымшаның басқа элементтері мен API-ға алаңдамады.
DeepSeek V4 Pro сәтті әрекеттің ең төменгі құнын көрсетті — $0,62, тапсырманы 10 іске қосудың 3-інде шешті. Бұл GPT-5.5-пен салыстырғанда шамамен 15 есе арзан, дегенмен сәтті шешімдер пайызы төмен. Мұндай айырмашылық қауіпсіздік құралдарын ауқымды қолданғанда маңызды болуы мүмкін.
Claude Sonnet 4.6 және Claude Opus 4.8 тапсырманы 10 жағдайдың 2-інде орындай алды. Opus бірнеше рет сәттілікке жақын болды, бірақ сессиялар қорғаныс механизмдерінің іске қосылуына байланысты аяқталды.
Gemini 3.1 Pro Preview тапсырманы орындаудан іс жүзінде әрдайым бас тартты, бұл медианалық токен санына да әсер етті — бар болғаны 9 мың, ал басқа модельдерде 100 мың және одан да көп. Gemini 3.5 Flash ұқсас нәтижелер көрсетті, тек екі жағдайда ғана тапсырманы шешуге әрекет жасады.
Модельдердің мінез-құлық ерекшеліктері
Эксперимент барысында қытайлық ЖИ-модельдер нақты деректер базаларымен тікелей әрекеттесуге бейім екені байқалды, ал батыстық модельдер дұрыс тәсілді тапқаннан кейін де сақтық танытты.
Эксперимент ғылыми бағалау болып табылмайды, бірақ заманауи ЖИ-модельдердің киберқауіпсіздікке жақын нақты жағдайларда мүмкіндіктерін жақсы құжатталған практикалық тест ретінде көрсетеді.
