Разоблачение гиперкомплексных слоев: почему они не работают в машинном обучении
В последние годы гиперкомплексные алгебры, такие как кватернионы, октонионы, седенионы и Clifford-слои, привлекли внимание исследователей благодаря обещаниям улучшенной параметрической эффективности и выразительности в задачах машинного обучения. Однако, проведя два месяца на эксперименты и бенчмаркинг, мы пришли к неожиданным выводам: преимущества этих алгебр исчезают, когда в сравнение добавляются правильно подобранные базовые модели на вещественных числах.
Real-ротация: проверяет, действительно ли некоммутативность играет роль.
Shuffled structure tensor: изолирует влияние конкретной алгебры.
Real HRR: проверяет, является ли выигрыш следствием просто связывания.
Real-ортогональность: исследует, действительно ли делители нуля обеспечивают преимущества.
Отражения недостижимы: группы симметрий, содержащие отражения, не могут быть описаны гиперкомплексными алгебрами.
Делители нуля не работают: гиперкомплексные алгебры не могут эффективно обрабатывать трехсторонние исключения.
Неассоциативность отменяет параллельные сканы: современные модели длинных последовательностей требуют ассоциативности для эффективной работы.
Привлекательность гиперкомплексных алгебр
Гиперкомплексные алгебры, начиная с вещественных чисел и заканчивая октонионами, представляют собой лестницу, где каждая ступень предлагает новые математические свойства. Например, кватернионы обеспечивают 3D-повороты, октонионы вводят неассоциативность, а седенионы — делители нуля. Эти свойства кажутся идеальными для применения в машинном обучении, где важны стабильность, чувствительность к порядку и возможность работы с логическими противоречиями.Контрольные эксперименты
Однако, как показали наши исследования, многие статьи о гиперкомплексных слоях не задают важный вопрос: по сравнению с чем проводятся эксперименты? Мы добавили несколько контрольных моделей, чтобы изолировать влияние экзотической алгебры от структурных особенностей. В результате, добавление одного лишь контроля сняло заявленное преимущество гиперкомплексных слоев в 8 из 8 случаев.Контрольные модели:
Результаты экспериментов
Наши эксперименты охватывали множество задач, включая ассоциативную память и детекцию противоречий. В результате, октонионные модели, которые ранее демонстрировали успехи, не смогли продемонстрировать преимущества по сравнению с базовыми моделями. Например, октонионная модель, которая доминировала на неабелевых группах, проиграла в сравнении с параметрически сопоставленной реальной ротацией.Неассоциативность и ее ограничения
Мы также исследовали, может ли неассоциативность действительно улучшить результаты. Для этого мы построили ассоциатор, который тождественно равен нулю для любой ассоциативной алгебры. Однако, даже в этом случае, параметрически сопоставленная реальная билинейная сеть показала аналогичные результаты, что указывает на то, что неассоциативность не является необходимым условием для успешного обучения.Пределы возможностей гиперкомплексных алгебр
В ходе исследования мы пришли к нескольким важным выводам о гиперкомплексных алгебрах:Выводы и рекомендации
Несмотря на привлекательность гиперкомплексных алгебр, наши исследования показывают, что они не обеспечивают ожидаемых преимуществ в задачах машинного обучения. Мы рекомендуем всем исследователям, работающим с структурированными архитектурами, включать в свои эксперименты контрольные модели, чтобы избежать ложных положительных результатов. Наша работа подчеркивает важность точности и прозрачности в исследованиях, и мы надеемся, что наши выводы помогут другим избежать тех же ошибок, что и мы.
Источник:
Хабр: Машинное обучение