Аннотация: Основное внимание этой статьи состоит в том, чтобы улучшить механизм оптимизации информационного узкого места и объяснить два момента, что взаимная информация сложная для оценки высокой широты пространства и торговле от проблемы в механизме оптимизации информационного узкого места.
Эта статья опубликована в сообществе HUAWEI CLOUD.«[Совместное создание Yunzhu] Оценка Meiwen: работа Большого Брата по кросс-модальной повторной идентификации пешеходов с помощью вариационной дистилляции», Автор: Цимин.
Объяснение диссертации: «Прощай, взаимная информация: вариационная дистилляция для кроссмодальной реидентификации личности»
Обзор бумаги
В этой статье основное внимание уделяется улучшению механизма оптимизации информационного узкого места и объяснению двух моментов, когда взаимную информацию трудно оценить в многомерном пространстве, и проблемы компромисса в механизме оптимизации информационного узкого места.
История исследования информационных узких мест
Этот отчет разделен на части 3. Чтобы облегчить понимание, мы сначала представляем предпосылки исследования узкого места информации.
Что касается понятия «информационное узкое место», то оно было официально предложено учеными примерно в 2000 году.Цель в идеальном состоянии состоит в том, чтобы получить минимально достаточный критерий. Это означает, что вся дискриминационная информация, полезная для задачи, извлекается, а избыточная информация отфильтровывается. С практической точки зрения, развертывание информационных узких мест заключается в непосредственной оптимизации части, выделенной красным цветом на рисунке ниже:
До сих пор информационное узкое место как метод обучения представлению под руководством теории информации широко использовалось во многих областях, включая компьютерное зрение, обработку естественного языка, нейробиологию и т. д. Конечно, некоторые ученые использовали информационное узкое место, чтобы выявить проблема открытия черного ящика нейронной сети.
Однако взаимное информирование имеет 3 недостатка:
1. Его эффективность сильно зависит от точности оценки взаимной информации.
Хотя информационное узкое место имеет передовые концепции и концепции, его эффективность сильно зависит от точности оценки взаимной информации. Согласно большому количеству теоретических анализов и множеству практических попыток, мы можем знать, что вычисление взаимной информации на самом деле очень эффективно в многомерном пространстве.
Из приведенного выше выражения
v представляет количество наблюдений, и вы можете напрямую понимать его как многомерную карту объектов;
z представляет собой его представление, которое можно понимать как низкоразмерное представление, полученное путем сжатия информации в узком месте.
Теперь нам нужно вычислить взаимную информацию между ними двумя.
Теоретически нам нужно знать эти три распределения, чтобы реализовать вычисление взаимной информации (как показано выше). Но, к сожалению, для потенциального распределения самого наблюдения у нас может быть только ограниченное количество точек данных, и мы не можем наблюдать его конкретное потенциальное распределение через эти ограниченные точки данных, не говоря уже о релевантной информации о пространственной переменной z.
Итак, что, если мы используем прокси-оценку, чтобы угадать в пространстве решений? Тоже не очень осуществимо. Поскольку его достоверность не очень высока, а на ICLR (Международной конференции по репрезентативному обучению) в прошлом году было проведено много работы, было доказано, что оценка взаимной информации, вероятно, является просто уловкой.
2. Сложные компромиссы между эффективностью прогнозирования и простотой
Еще одна серьезная проблема заключается в том, что оптимизация информационной платформы по сути является компромиссом. Это означает, что данный механизм ставит разборчивость и краткость представления по обе стороны шкалы (на фото выше).
Если вы хотите устранить избыточную информацию, это также приведет к потере части дискриминационной информации, но если вы хотите сохранить больше дискриминационной информации, то значительная часть избыточной информации также будет сохранена. Таким образом, первоначальная цель информационного узкого места становится невыполнимой.
Или давайте посмотрим на это с точки зрения оптимизации. Предположим, мы задаем очень большое значение β, что означает, что модель в это время более склонна к обрезке. Очевидно, что прочность на сжатие повышена, но в настоящее время модель не сохраняет большого значения.
Точно так же, если дано очень маленькое значение β (скажем, 10^(-5)), то модель относительно более склонна к достижению цели, заданной первым элементом взаимной информации. Но на данный момент модель не заботится об «устранении избыточности».
Таким образом, в процессе выбора β мы фактически взвешиваем важность двух целей под разные задачи, что также подтверждает проблему, упомянутую в начале статьи Суть оптимизации информационных узких мест заключается в компромиссе.
3. Слабость в вопросах множественности взглядов
В дополнение к двум вышеупомянутым проблемам мы также можем обнаружить, что, хотя узкое место информации может быть определено бинарным определением информации, содержащейся в задаче, через заданную метку задачи, то есть мы можем определить дискриминацию в соответствии с полезно ли это для задачи или нет Сексуальная информация (красная часть) и избыточная информация (синяя часть).
Однако, когда задача включает в себя данные с несколькими представлениями, у информационного узкого места нет точного основания для перезаписи информации с точки зрения нескольких представлений.Следствием этого является то, что он более чувствителен к изменениям представления, или, другими словами, ему не хватает способность решать многозадачные задачи.
Введение в работу с узким местом вариационной информации
После обсуждения традиционного информационного узкого места мы представляем еще одну важную работу: «Вариационное информационное узкое место». Эта работа была опубликована на ICLR в 2017 году. Одним из ее выдающихся достижений является введение «вариационного вывода» (как показано ниже): ** Преобразование взаимной информации в форму энтропии. **Хотя эта работа не решает проблем, о которых мы упоминали ранее, эта идея вдохновляла почти все последующие родственные работы.
Преобразование взаимной информации в энтропию — очень большой шаг вперед. Но есть еще некоторые недостатки:
1. Компромисс между эффективностью различения представления и простотой не разрешен.
К сожалению, узкое место в вариационной информации не решило проблему компромисса между различимостью и простотой механизма оптимизации. Оптимизированный баланс по-прежнему колеблется в зависимости от λ.
2. Справедливость вариационной верхней границы не может быть гарантирована.
Вторая проблема заключается в том, что при оптимизации узкого места вариационной информации это фактически является верхней границей для оптимизации, но достоверность верхней границы является спорной. Потому что для аппроксимации скрытого распределения P(z) требуется яркое распределение Q(z) пространственной переменной z. Однако это на самом деле очень трудно гарантировать на практике.
3. Использование сложных операций, таких как тяжелые параметры и передискретизация
Третий момент заключается в оптимизации результата этого вариационного вывода, который будет включать в себя множество сложных операций (перепараметрирование, повторная выборка и другие операции с высокой неопределенностью), которые добавят некоторую флуктуацию в процесс обучения, делая возможным обучение. не очень стабилен, а сложность высока.
Методы исследования
Упомянутые выше проблемы являются общими проблемами вариационных методов нацеливания на информационные узкие места, которые в определенной степени препятствуют временному применению информационных узких мест. Затем давайте объясним соответствующие идеи решения, чтобы решить все проблемы, упомянутые выше, по существу.
достаточность
Сначала необходимо ввести понятие «адекватности»: z содержит всю различительную информацию об y.
Это требует, чтобы процесс кодирования информационного узкого места не допускал потери различительной информации, то есть после того, как v достигает z через информационное узкое место, допускается устранение только избыточной информации.Конечно, это идеальное требование. (как показано на рисунке выше).
С концепцией «адекватности» мы разделяем взаимную информацию между наблюдением и его представлением, и мы можем получить избыточную информацию синим цветом и дискриминационную информацию красным цветом, а затем в соответствии с неравенством обработки информации мы можем получить следующее линия результат. Этот результат имеет большое значение, и он показывает, что нам нужно пройти через три подпроцесса, чтобы получить минимально достаточный стандарт, то есть оптимальный стандарт.
Первый подпроцесс фактически повышает верхний предел общего количества различительной информации, содержащейся в представлении z. почему ты так говоришь? Потому что все, что содержится в z, получено из его наблюдений. Следовательно, увеличение числа наблюдений, своего собственного верхнего предела общего количества различительной информации, также повышает свой собственный верхний предел z.
Второй подпроцесс заключается в том, чтобы позволить представлению z приблизиться к своему верхнему дискриминационному пределу. Эти два фактически соответствуют требованиям достаточности.
Условная взаимная информация третьего подпроцесса, как упоминалось выше, представляет собой избыточную информацию, содержащуюся в цели, поэтому минимизация этого члена соответствует простейшей цели. Здесь кратко объясните «условную взаимную информацию», которая представляет собой информацию, содержащуюся в z, которая относится только к v и не имеет ничего общего с y. Короче говоря, это избыточная информация, не связанная с задачей. Фактически, первый подпроцесс можно увидеть из предыдущего узкого места вариационной информации, Фактически оптимизируется условная энтропия, то есть перекрестная энтропия вычисляется с использованием исходной карты признаков и метки наблюдения v, а затем выполняется оптимизация. Таким образом, это по существу то же самое, что и данная задача, поэтому в настоящее время не требуется специального лечения.
Что касается двух других целей оптимизации, то они по существу эквивалентны. И стоит отметить, что это отношение эквивалентности означает, что в процессе улучшения дискриминативности представления оно также устраняет избыточность. Поставив две цели, которые когда-то были противоположны, на одну чашу весов, первоначальная проблема компромисса информационного узкого места напрямую устраняется, и информационное узкое место теоретически возможно при минимально достаточном стандарте.
Теорема 1 и лемма 1
Теорема 1: Минимизация I(v;y) − I(z;y) эквивалентна минимизации разности условной энтропии v,z по отношению к цели задачи y, а именно:
minI(v;y)−I(z;y) ⇔ minH(y|z)−H(y|v),
где условная энтропия определяется как H(y|z):=−∫p(z)dz∫p(y|z)log p(y|z)dy .
Лемма первая: Представление z является достаточным для цели задачи y, когда его предсказание цели задачи y совпадает с его наблюдением v, то есть:
Для достижения поставленных выше целей также необходимо избегать оценки взаимной информации в многомерном пространстве, поэтому в статье предлагаются две очень подробные теоремы и леммы.
Для простоты понимания вы можете увидеть логическую схему выше. Теорема 1 напрямую преобразуется в разность условных энтропий путем оптимизации взаимной информации синего цвета. То есть, если вы хотите достичь двух вышеуказанных (синих) целей, вы можете превратить это в минимизацию разницы в условной энтропии.
И лемма 1, на этом основании приведенный выше результат трансформируется в КЛ-дивергенцию, а в КЛ-дивергенции фактически два логита.
То есть на практике необходимо только оптимизировать такую простую KL-дивергенцию, чтобы одновременно добиться достаточности и простоты представления. По сравнению с традиционным информационным узким местом, это все еще намного проще.
Сама структура сети проста: один энкодер, одно информационное узкое место и одно расхождение KL. Учитывая его форму, этот метод также называется вариационной самодистилляцией или сокращенно VSD.
По сравнению с первоначальным механизмом оптимизации узкого места взаимной информации можно обнаружить, что VSD имеет три заметных преимущества:
-
Нет необходимости во взаимной оценке информации и более точной подгонке
-
Решение компромиссов в оптимизации
-
Никаких утомительных операций, таких как тяжелые параметры и выборка, не требуется.
Consistency
Только информация, которая является различительной и удовлетворяет согласованности между представлениями, сохраняется для повышения надежности представления для просмотра изменений.
****определение:Представление z1, z2 удовлетворяет межвидовой непротиворечивости тогда и только тогда, когда I(z1;y) = I(v1v2;y) = I(z2;y).
После получения теоремы 1 и леммы 1 следующая задача состоит в том, чтобы распространить вариационную автодистилляцию на контекст обучения с несколькими представлениями.
Как показано выше, это базовая структура. Два изображения x1, x2 вводятся в кодировщик для получения двух исходных высокоразмерных карт признаков v1 и v2, а затем v1 и v2 отправляются в информационное узкое место для получения двух сжатых низкоразмерных представлений z1 и z2.
Как показано на рисунке выше, эта взаимная информация представляет собой взаимную информацию между наблюдениями и их представлениями в одном и том же представлении. Но при разбиении обратите внимание на разницу с обработкой в VSD,Потому что разделение информации здесь основано на том, отражает ли она общность взглядов, а не на требованиях различения и избыточности., поэтому результатом его расщепления является I(Z1;V2) = i(v2;v1|y) + I(z1;y).
Затем, в зависимости от того, соответствуют ли представления дискриминационным требованиям, информация об общих чертах между представлениями иерархии делится на две части: избыточную информацию и дискриминационную информацию (как показано на рисунке выше).
Если вы хотите улучшить надежность представления для просмотра изменений и, таким образом, повысить точность задачи, вам нужно только сохранить I(z1;y) (красная часть), I(v1;z1|v2) (синяя часть ) и I(v2;v1|y) (зеленая часть) отбрасываются. Цели оптимизации следующие:
Теорема 2: Для двух наблюдений v1, v2, удовлетворяющих достаточности, их соответствующие представления z1 и z2 удовлетворяют согласованности между представлениями тогда и только тогда, когда выполняется это условие: I(v1;z1|v2) + I(v2;z2 |v1)≤0 и I(v2;v1|y) + I(v1;v2|y) ≤ 0
Теорему 2 можно использовать для иллюстрации природы непротиворечивости взглядов. Согласованность между представлениями по существу требует исключения информации, относящейся к представлению, и избыточной информации, не относящейся к задаче, для максимального представления.
два метода
Удаление информации, относящейся к представлению
Вариационное взаимное обучение (VML, соответствующее синей части рисунка выше): минимизация расхождения JS между распределениями предсказания z1, z2, чтобы исключить содержащуюся в них информацию, относящуюся к представлению.Конкретные цели заключаются в следующем:
Избавьтесь от лишней информации
Вариационная перекрестная дистилляция (VCD, соответствующая красной части на приведенном выше рисунке): в сохраненной информации о согласованности представления дискриминационная информация очищается путем перекрестной оптимизации расхождения KL между наблюдением и различными представлениями представления, и в то же время Устраните избыточную информацию, конкретные цели заключаются в следующем (v1 и z1 одинаковы):
На рисунке выше представлена блок-схема обработки этих двух методов. Первоначально есть специфичность и согласованность.Согласно VML, информация делится на двоичную, а затем используется вариативное взаимное обучение для устранения всей характерной информации, а затем есть две оставшиеся оранжевые непротиворечивые сведения: информация об избыточности и информация о суждениях. В настоящее время требуется вариационная перекрестная дистилляция, чтобы исключить избыточную информацию (зеленая часть) отдельно и сохранить только дискриминационную информацию (красная часть).
Результаты экспериментов
Далее разберем экспериментальную часть статьи. Чтобы проверить эффективность метода, мы применяем три упомянутых выше метода: вариативную самодистилляцию, кросс-дистилляцию и взаимное обучение к задаче кросс-модального распознавания пешеходов.
Проблема кросс-модального распознавания толпы — это подзадача информатики, и основная цель — сопоставить данного человека с фотографией в другой модальности. Например, для инфракрасного изображения, отмеченного зеленым прямоугольником на рисунке ниже, мы надеемся найти изображения в видимом свете, соответствующие одному и тому же человеку в библиотеке изображений, либо используя инфракрасный свет, чтобы найти видимый свет, либо используя видимый свет, чтобы найти инфракрасный свет. светлый.
Обзор фреймворка
Обзор структуры модели
Общая модель состоит из трех независимых ветвей, и каждая ветвь содержит только один кодировщик и одно информационное узкое место. Конкретная структура показана на рисунке ниже.
Здесь стоит отметить, что из-за верхней и нижней ветвей оранжевая часть принимает и обрабатывает только инфракрасный свет, а синяя часть принимает и обрабатывает только видимый свет, поэтому они не предполагают многократных просмотров, поэтому они связаны с VSD. Может.
Когда средняя ветвь обучена, она будет принимать и обрабатывать данные из двух модальностей одновременно. Поэтому при обучении с использованием ВКД проводится сообучающий анализ вариативной перегонки и вариационного взаимообучения.
Обзор функций потерь
Функция потерь состоит из двух частей: вариационной дистилляции, предложенной в статье, и наиболее часто используемых обучающих ограничений для Re-ID. Обратите внимание, что VSD ограничивает только одномодальные ответвления, в то время как VCD работает с VML для ограничения перекрестных переходов.
Экспериментальный стандарт: SYSU-MM01 и RegDB
SYSU-MM01:
Набор данных включает в общей сложности 287 628 изображений в видимом свете и 15 792 изображения в инфракрасном свете 491 объекта. Изображения каждой мишени снимаются 6 непересекающимися камерами в помещении и на улице.
Критерии оценки включают полноэкранный запрос (all-search) и поиск в помещении (indoorsearch). Все экспериментальные результаты в статье используют стандартные критерии оценки.
РегБД:
Набор данных включает в общей сложности 412 целей, и каждая цель соответствует десяти изображениям в видимом свете и изображениям в инфракрасном свете, сделанным одновременно.
Критерии оценки включают поиск в видимом свете в инфракрасном диапазоне (от видимого к инфракрасному) и поиск в инфракрасном диапазоне видимого света (от инфракрасного в видимый). Конечным результатом оценки является средняя точность десяти экспериментов, и каждый эксперимент выполняется на случайно разделенном наборе оценок.
Анализ результатов
Мы грубо делим связанную работу по кросс-модальному распознаванию толпы на четыре категории: сетевой дизайн, метрический дизайн, генеративный и репрезентативный.
Будучи первой работой по исследованию репрезентативного обучения, этот метод по-прежнему может лидировать в конкурентной борьбе с таким большим отрывом, не затрагивая процесс выживания и сложную структуру сети. И это также причина того, что вариационная потеря дистилляции, предложенная в этой статье, может быть легко интегрирована в различные категории методов, чтобы раскрыть больший потенциал.
На другом наборе данных мы можем увидеть аналогичный результат.
Далее мы выберем несколько репрезентативных экспериментов по абляции, чтобы проанализировать эффективность метода на практике.
Прежде чем мы начнем, нам нужно прояснить, что во всех следующих экспериментах: размерность наблюдения v единообразно установлена равной 2048, что обычно используется в сообществе Re-ID; размерность представления по умолчанию равна 256; информация узкое место единообразно использует оценщик взаимной информации GS.
Эксперименты по абляции: вариационная дистилляция и информационное узкое место в условиях одной модальной ветви
Мы фокусируемся только на репрезентативной адекватности, не рассматривая условия множественного представления.
Как показано выше, мы можем наблюдать, что вариационная самодистилляция может принести огромный прирост производительности. от 28,69 до 59,62, очень интуитивное число,Это показывает, что вариационная самоочистка может эффективно улучшить дискриминативность представления и извлекать более ценную информацию, удаляя при этом много избыточной информации..
Эксперименты по абляции: вариационная дистилляция и информационное узкое место при мультимодальном ветвлении
Давайте посмотрим на результаты под мультипросмотром. Когда мы тестировали только кросс-модальные ветки, мы обнаружили два феномена:
Во-первых, производительность метода вариационной дистилляции ухудшается. Только что было 59, а сейчас только 49. Здесь мы предполагаем, что некоторая информация, специфичная для модальности, отбрасывается. Средняя оценка сохраняет информацию, которая одновременно удовлетворяет обеим характеристикам, поэтому эта информация, специфичная для модальности, будет отброшена в первую очередь. Однако отбрасываемая информация о модальности также весьма различительна.Таким образом, достигается цена модальной согласованности, то есть потеря точности из-за потери дискриминанта.
Во-вторых, производительность традиционного информационного узкого места.При условии мультимодальности изменение не очень велико. Только что было 28, сейчас 24. Мы думаем, что традиционное информационное узкое место плохо различает непротиворечивую и конкретную информацию, потому что оно вообще не обращает внимания на проблему множественности представлений и вообще не имеет возможности справиться с этой проблемой. Поэтому условие многократных просмотров не принесет ему существенных колебаний.
Эксперименты по абляции: вариационная дистилляция и информационное узкое место в условиях трех ветвей
На основе двойной ветви после добавления средней ветви общая производительность модели практически не изменилась. Мы можем сделать следующие выводы:
Верхняя и нижняя ветви, пока удовлетворяется дискриминационная информация, информация может быть сохранена.
Информация, хранящаяся в средней ветви, должна удовлетворять двум требованиям. Одним из них является удовлетворение дискриминационным требованиям, то есть информация, хранящаяся в средней ветви, фактически является подмножеством верхней и нижней информации.
В отличие от информационного узкого места, улучшение, которое могут привнести три ветви, относительно очевидно. Потому что ни одна из его ветвей не может полностью сохранить дискриминационную информацию, не говоря уже о том, чтобы учесть вопрос «множественности взглядов».
Эксперименты по абляции: сравнение «достаточности» при различных коэффициентах сжатия
Давайте посмотрим на влияние степени сжатия представления на производительность. В соответствии с единым стандартом дизайна Re-ID исходная размерность карты объектов рассчитана на 2048.
Мы меняем производительность популяции модели, корректируя представление v. Когда размер меньше 256, производительность будет продолжать расти по мере увеличения размера.Мы предполагаем, что это происходит потому, что при слишком сильном сжатии, независимо от того, насколько сильна модель, не так много каналов для хранения достаточного количества дискриминационной информации., легко привести к явлению недостаточности.
Когда размерность превышает 256, обнаруживается, что производительность начинает снижаться. Что касается этого момента, мы считаем, что дополнительный канал, наоборот, позволяет сохранить некоторую избыточную информацию, что снижает общую дискриминативность и обобщение. В настоящее время это явление получило название «избыточность» (Redundancy).
Чтобы лучше показать разницу между разными методами, мы используем TFNE для объединения разных пространств признаков в плоскость (как показано на рисунке ниже).
Сначала проанализируем достаточность, то есть сравнение ВСД и традиционных информационных узких мест. Верхние индексы «V» и «I» представляют данные в видимом и инфракрасном свете, а нижний индекс Sp представляет данные, специфичные для просмотра, что означает, что они взяты из одномодального анализа.
Мы видим, что пространство признаков традиционного информационного узкого места можно назвать хаотичным, что указывает на то, что модель не может четко различать категории различных целей. Иными словами, потеря дискриминационной информации серьезна, тогда как при ДМЖП ситуация совершенно обратная, хотя разница в пространстве признаков между разными модальностями все же большая, поскольку значительная часть хранимой дискриминационной информации принадлежит модальностям. Конкретная информация, но видно, что почти каждая ошибка четкая и отчетливая, что указывает на то, что модель может лучше соответствовать адекватности с помощью VSD.
Давайте посмотрим на картинку ниже. Нижний индекс ш означает, что они происходят из общей ветви, и они происходят из мультимодальной ветви. Верхние индексы «V» и «I» по-прежнему представляют точки данных видимого света и инфракрасного света.
Функциональное пространство одного и того же информационного узкого места все еще хаотично при условии множественных просмотров. А если объяснения нет, то в принципе невозможно различить, какой из двух образов одномодальный, а какой многомодальный. Это также подтверждает предыдущий пункт:Традиционные информационные узкие места просто не в состоянии справиться с проблемами с несколькими представлениями..
Хотя пространство признаков, обработанное методом вариационной перекрестной дистилляции, является несколько свободным по сравнению с VSD (поскольку требования представления неизбежно вызовут некоторую потерю дискриминационной информации), степень совпадения пространства признаков двух модальностей очень высока. обратите внимание, что подход предполагает достоверность информации о согласованности.
Затем мы проецируем данные из разных модальностей в одно и то же пространство признаков, при этом оранжевый и синий цвета представляют точки данных инфракрасного и видимого изображения соответственно.
Мы видим, что с помощью вариационной перекрестной дистилляции пространства признаков различных модальностей согласуются почти точно. Сравнение результатов информационного узкого места может быть очень интуитивно понятным, чтобы проиллюстрировать эффективность вариационной перекрестной дистилляции.
воспроизведение кода
Сравнение производительности: Pytorch против Mindspore
Независимо от того, используете ли вы PyTorch или MindSpore, они используются для обучения модели, и тест производительности должен использовать полученную модель для извлечения функций и отправки их в соответствующие данные и официально поддерживаемые тестовые файлы, поэтому сравнение результатов должно быть честным. .из.
Мы можем видеть, является ли это базовым уровнем или всей структурой (поскольку эксперимент в правом нижнем углу находится только на полпути, я могу поставить только один посередине), как с точки зрения точности, так и времени обучения, MindSpore Полученная модель по-прежнему намного лучше, чем PyTorch.
Если вы заинтересованы в MindSpore, вы можете узнать:
Woohoo. Huawei cloud.com/product/touch…
Нажмите «Подписаться», чтобы впервые узнать о новых технологиях HUAWEI CLOUD~