Яндекс дауыстық командаларды жетілдіру әдісін ұсынды
«Яндекс» зерттеушілері жаңа модульдік әдісті ұсынды, ол арқылы ақылды құрылғыларға дауыс командаларын бұрыннан белгілі сөз тіркестерін тану сапасын төмендетпей қосуға болады. Бұл шешім «катастрофалық ұмытуды» азайтады және ресурстары шектеулі құрылғыларға да қолайлы.
Crius
«Яндекс» компаниясының зерттеушілері ақылды құрылғыларға арналған триггер-сөздерді жаңарту кезінде «катастрофалық ұмыту» мәселесін шешуге мүмкіндік беретін жаңа әдіс ойлап тапты. Бұл тәсіл жаңа дауыстық командаларды тану мүмкіндігін сақтай отырып, бұрыннан белгілі сөз тіркестерін анықтау қабілетін жоғалтпайды. Әдістің сипаттамасы 2026 жылы 27 қыркүйек пен 1 қазан аралығында Сиднейде өтетін Interspeech халықаралық конференциясында ұсынылады.
Катастрофалық ұмыту мәселесі
Ақылды колонкалар, автокөлік ассистенттері және басқа да дауыстық көмекшілер өндірушілері құрылғылардың интернетке қосылмай-ақ жаңа командаларды тану мүмкіндігін үнемі кеңейтіп отырады. Бұл үшін модельдер әдетте жаңа деректерде қосымша оқытылады. Алайда жаңартудан кейін құрылғылар бұрынғы таныс командаларды нашар тануы мүмкін. Машиналық оқытуда бұл құбылыс «катастрофалық ұмыту» деп аталады. Оны азайту үшін үздіксіз оқыту әдістері, мысалы, elastic weight consolidation (EWC) қолданылады, бірақ олар мәселені толық шешпейді, тек әлсіретеді.
Жаңа модульдік тәсіл
«Яндексте» жасалған әдіс модельді модульдік түрде кеңейтуге негізделген. Нейрондық желінің бүкіл құрылымын өзгертудің орнына, жаңа командаларды тануға жауап беретін шағын қосымша оқытылатын модуль қосылады. Бұл модуль негізгі модельден алынған белгілерді пайдаланады және жаңа командаларға арналған жеке классификаторы бар. Негізгі модельдің параметрлері, оның ішінде нормализация мен басты классификатор, өзгеріссіз қалады. Мұндай тәсіл ескі командаларды тану дәлдігін сақтауға мүмкіндік береді, ал жаңа командалар тек қосымша модульді оқыту арқылы енгізіледі, бүкіл жүйені қайта құрудың қажеті жоқ. Бұл кезде нейрондық желінің көлемі 10%-дан аз ғана ұлғаяды.
Басқа әдістермен салыстыру
Google Speech Commands ашық деректер жиынтығында жүргізілген тәжірибелерде жаңа тәсілдің тиімділігі тексерілді. Модель жаңа командаларды үйренгенде, бұрыннан белгілі сөздерді тану сапасы төмендеген жоқ. Жаңа әдіс жаңа командаларды өткізіп алу көрсеткішін (false reject rate, FRR) 6,46%-дан 4,37%-ға дейін төмендетті, бұл ұқсас көлемдегі жеке модельмен салыстырғанда жақсы нәтиже. Сондай-ақ, ол адаптерлер мен LoRA әдістерінен да жақсы нәтиже көрсетті. Бүкіл модельді толық оқытқанда жаңа командалар жақсы меңгерілді, бірақ ескі командаларды тану дәлдігі айтарлықтай төмендеді: ұмытылған ескі командалардың орташа үлесі 2,71%-дан 69,08%-ға дейін өсті.
Қолдану салалары
Ұсынылған тәсілді ақылды колонкаларда, тұрмыстық техникада, автокөліктегі дауыстық көмекшілерде және есептеу ресурстары шектеулі басқа да құрылғыларда қолдануға болады.
