Центральная Научная Библиотека  
Главная
 
Новости
 
Разделы
 
Работы
 
Контакты
 
E-mail
 
  Главная    

 

  Поиск:  

Меню 

· Главная
· Биология
· Геология
· Зоология
· Коммуникации и связь
· Бухучет управленчучет
· Водоснабжение   водоотведение
· Детали машин
· Инновационный   менеджмент
· Качество упр-е   качеством
· Маркетинг
· Математика
· Мировая экономика МЭО
· Политология
· Реклама и PR
· САПР
· Биология и химия
· Животные
· Литература   языковедение
· Менеджмент
· Не Российское   законодательство
· Нотариат
· Информатика
· Исторические личности
· Кибернетика
· Коммуникация и связь
· Косметология
· Криминалистика
· Криминология
· Наука и техника
· Кулинария
· Культурология
· Логика
· Логистика
· Международное   публичное право
· Международное частное   право
· Международные   отношения
· Культура и искусства
· Металлургия
· Муниципальноое право
· Налогообложение
· Оккультизм и уфология
· Педагогика


Реферат: Кодеры речи

Реферат: Кодеры речи

Глава1 Кодеры формы.

Кодеры формы характеризуются способностью сохранять основную форму речевого сигнала. Кодеры формы не являются специфичными для речи в том смысле, что они с успе­хом работают с любой формой входного сигнала, и их применение ограничено только пределами амплитуды и шириной полосы. Сохраняя огибающую формы сигнала, подобные кодеры работают по принципу выборка-выборка, и их характеристики эффективно измеряются отношением сигнал/шум (ОСШ), так как квантование является основным источником искажений формы выходного сигнала.

ИКМ первый мировой стандарт кодирования речи со скоростью 64 кбит/с с логарифмическим сжатием (по μ-закону для Северной Америки и А-закону для Европы). ИКМ-кодер является кодером формы и все еще широко используется в цифровых системах. ИКМ со скоростью 64 кбит/с в основном используется как предварительное звено низкоскоростных речевых кодеров, поскольку ее характеристики считаются очень высоко­качественными. Позже был разработан стандарт на адаптивную дифференциальную ИКМ (АДИКМ) со скоростью 32 кбит/с. Снижение скорости цифрового потока наполовину было достигнуто благодаря использованию адаптивного предсказания и адаптивных квантователей для устранения избыточности речи. Некоторые другие кодеры, например с дельта-модуляцией и плавно изменяющейся крутизной (CVSDM — Continuous Variable Slope Delta Modulation) на скорости 32 кбит/с, используются для решения специфичных задач. Хотя подобные высокоскоростные алгоритмы кодирования малоэффективны, они, тем не менее, остаются самыми эксплуатируемыми системами и, возможно, будут оставаться таковыми еще некоторое время.

Импульсно-кодовая модуляция ИКМ (РСМ – Pulse Code Modulation). Рекомендация G.711

При построении систем цифровой передачи непрерывных сообщений принципиальным моментом является определение полосы частот, требуемой для обеспечения заданного качества воспроизведения переданного сообщения. Вообще говоря, для высококачественной передачи речевого сообще­ния требуется полоса не менее 10 кГц.

Однако для достижения удовлетвори­тельного уровня разборчивости при пе­редаче речи по телефонным каналам достаточно передать спектр в полосе 300...3400 Гц. Именно такой спектр звуковых частот обычно передается в современных системах передачи рече­вой информации.

Как правило, максимальная частота передаваемого спектра аудио­сигнала выбирается равной ,а частота дискретизации  (например, рекомендации G.711, G.721), хотя в ряде случаев с целью повышения качества передачи используются и более высокие значе­ния этих величин (например, рекомен­дация G.722).

При использовании ИКМ дискретизированное сообщение подвергается квантованию по L уровням (рис. 1.1), в результате чего каждому значе­нию  ставится в соответствие чи­сло , , представленное n-разрядной комбинацией двоичного кода.

Для достижения приемлемого ка­чества восприятия восстановленного речевого сообщения при равномерном (простом) квантовании необходимо . Столь большое число  уровней квантования при  требует скорости передачи символов в канале не менее .

Рисунок 1.1

Однако в связи с тем, что при восприятии речи человеческим ухом в области больших мгновенных значений  оказываются допустимыми значительно большие искажения сообщения, чем в области малых мгновенных значений, требуемое число уровней квантования может быть существенно снижено путем использования неравномерного квантования, используя компрессию исходного сообщения по логарифмическому закону с последующим равномерным квантованием при сравнительно малом числе уровней (например, при  или путем соответствующего цифрового преобразования (цифровой компрессии) сообщения, предварительно преобразованного в цифровую форму при сравнительно большом исходном числе уровней квантования (например, при ).

Оптимальный квантователь имеет преимущества, если динамический диапазон входного сигнала фиксирован и достаточно мал. Характеристики квантователя быстро ухудшаются, мощность сигнала изменяется относительно значения, на которое он был рассчитан. Хотя этим процессом можно управлять, нормализуя входной сигнал и приводя его к единому диа­пазону, для правильного определения масштаба амплитуды восстановленно­го после квантователя сигнала потре­буется дополнительно несколько бит, необходимых для передачи динамиче­ского диапазона сигнала в определен­ные моменты времени.

Для обработки входных речевых сигналов с большим динамическим диапазоном используются два зако­на сжатия, называемые импульсно-кодовой модуляцией по закону  (А-ИКМ) и по закону μ (μ-ИКМ). В обеих схемах характеристика от­ношения сигнал/шум квантования (ОСШкв) должна быть близка к харак­теристике для простого квантователя. Вместе с тем характеристики А-ИКМ и μ-ИКМ существенно не изменяют­ся и остаются сравнительно постоян­ными в большом диапазоне уровней входного сигнала. По сравнению с про­стыми квантователями (рис. 1.1) кван­тователи сжатия требуют меньше бит на входную выборку для определен­ного динамического диапазона сжатия и меньшего ОСШкв. В квантователях сжатия уровни квантования находятся в области малых амплитуд, которые увеличиваются при увеличении диа­пазона входного сигнала. Благодаря этому при квантовании речевых сигналов, у которых максимум функции распределения вероятностей находится в начале координат, наиболее ча­сто встречающиеся малые амплитуды квантуются с большей точностью, чем менее вероятные большие амплитуды, что приводит к значительно лучшим, Чем у простого квантователя, характер­истикам.

Сжатие по А-закону определяется зависимостью:

                                                              (1.1)

где A — параметр сжатия с типовыми значениями 86 (Северо-Американская ИКМ) и 87,56 (Европейская ИКМ) для семибитных речевых квантователей.

Сжатие по μ-закону определяется выражением

                                                                  (1.2)

где V0 задается формулой , в которой L – нагрузочный фактор, a среднеквадратическое значение входного речевого сигнала.

Типовое значение фактора сжатия μ равно 255. Выражение (1.1) пока­зывает, что А-закон это комбина­ция логарифмической кривой, исполь­зуемой для больших амплитуд, и ли­нейного участка, используемого на ма­лых амплитудах. μ-закон не являет­ся в точности линейным или логариф­мическим ни в одном диапазоне, од­нако является приблизительно линей­ным для малых амплитуд и прибли­зительно логарифмическим для боль­ших амплитуд. Сравнение между квантователем по μ-закону и опти­мальным квантователем показало, что оптимальный квантователь дает вы­игрыш 4 дБ, однако может иметь бо­лее высокий уровень фонового шума, когда канал свободен, и его динамиче­ский диапазон сведен к минимальному диапазону входного сигнала. Поэтому наиболее предпочтителен логарифми­ческий квантователь.

Цифровое преобразование непре­рывного речевого сообщения в соответ­ствии с рекомендацией G.711 (рис. 1.2) используется наиболее часто.

Рисунок 1.2

 При этом ; частота дискретизации . После равномерного квантования при числе уровней и предварительного кодирования производится цифровая компрессия, в результате чего длина кодовой комбинации уменьшается до  разрядов. Результатом преобразования является двоичная последовательность, передаваемая со скоростью 64 кбит/с.

Из различных систем адаптивной ИКМ (АИКМ) наибольшее распространение получила система блочной ИКМ (БИКМ), оторую часто называют системой с почти мгновенным компандированием (NIC — Near Instantaneous Companding).

Отсчеты n-разрядного АЦП разбивают на блоки по N отсчетов. В каждом блоке находят отсчет с макси­мальным для данного блока уровнем. Этому уровню соответствует определенный номер старшего значащего раз­ряда (j), и все старшие разряды в ком­бинациях этого блока будут нулевыми. Записанный в двоичном коде но­мер этого разряда образует масштабную информацию, которая из-за своей важности, как правило, защищается помехоустойчивым кодом. В результате масштабная информация вместе с проверочными символами образует m-значную комбинацию, которую добавляют к основной информации.

Основная информация формируется выбором k разрядов из n исходных разрядов, причем первым (старшим) разрядом является разряд с номером, описанным в масштабной информации.

Основная информация для каждого из блоков объединяется с масштабной в единый цифровой поток. Результирующая скорость цифрового потока на выходе системы БИКМ . На практике, как правило, используют следующие параметры: .

При одинаковых условиях передачи БИКМ дает лучшее качество, чем ИКМ.    Поэтому можно снизить скорость передачи до 32.. .56 кбит/с.

Дифференциальная импульсно-кодовая модуляция ДИКМ (DPCM – Differencial Pulse Code Modulation)

Наряду с ИКМ применяются и более эффективные цифровые методы передачи речи. В частности, с целью снижения требований к пропускной способности канала можно использовать наличие корреляции между от­четными значениями передаваемого сообщения. Такой метод называется передачей с предсказанием. При этом последовательность значений  поступает на один вход вычитающего устройства (рис. 1.3,а), в то время как на другой вход поступает предсказанное значение , полученное тем или иным методом в устройстве предска­зания на основе анализа как преды­дущих отсчетных значений сообщения, так и текущих передаваемых значений на входе вычитающего устройства.

Рисунок 1.3

На приемном конце значения сооб­щения  восстанавливаются путем добавления принятого сигнала ошибки предсказания  к предсказываемому значению  (рис. 1.3,б).

В системе с дифференциаль­ной импульсно-кодовой модуляци­ей (ДИКМ) отсчетные значения  ошибки предсказания подвергаются квантованию с переходом к значениям  аналогично тому, как это делает­ся при использовании обычной ИКМ, однако при существенно меньшем числе уровней квантования. Таким обра­зом, при одинаковом качестве переда­чи речи метод ДИКМ позволяет ис­пользовать меньшее число разрядов n в кодовых комбинациях по сравне­нию с ИКМ. При этом существует большое число различных вариантов реализации метода ДИКМ, наиболее типичный из которых представлен на рис. 1.4.

Рисунок 1.4

При этом имеют место соотноше­ния:

                      (1.3)

Классификационными признака­ми кодеров ДИКМ считаются нали­чие блока линейного предсказания ав­торегрессионных последовательностей (предсказателя) и использование мно­гоуровневого (больше двух уровней) квантователя. Блок линейного пред­сказания может состоять из двух ча­стей — долговременного и кратковре­менного предсказателей. В канал пе­редается разность истинного и пред­сказанного значений сигнала (сигнал-остаток, он же погрешность пред­сказания). Системы с ДИКМ обеспе­чивают такое качество восстановления сигнала, которое сопоставимо с предоставляемым ИКМ, и на порядок более высокую помехоустойчивость.

Эффективность метода ДИКМ может быть повышена путем пере хода к адаптивной дифференциальной импульсно-кодовой модуляции АДИКМ.

Адаптивная дифференциальная импульсно-кодовая модуляция (ADPCM — Adaptive Differencial Pulse Code Modulation). Рекомендации G.721 и G.726

ADPCM один из наиболее об­щепринятых и давно используемых ал­горитмов сжатия речи, который регла­ментируется стандартом G.726, был принят в 1984 г. Этот алгоритм да­ет практически такое же качество вос­произведения речи, как и РСМ, однако для передачи информации при его ис­пользовании требуется всего 32 кбит/с. Метод основан на том, что в анало­говом сигнале, передающем речь, не­возможны резкие скачки интенсивно­сти. Поэтому, если кодировать не са­му амплитуду сигнала, а ее измене­ние по сравнению с предыдущим зна­чением, то можно обойтись меньшим числом разрядов. В ADPCM изменение уровня сигнала кодируется четырехразрядным числом, при этом частота измерения амплитуды сигнала сохраняется неизменной.

Все методы кодирования, основанные на определенных предположениях о форме сигнала, плохо работают в ситуации, когда сигнал может передаваться с резкими скачками амплитуды. Именно такой вид имеет аудиосигнал, генерируемый модемам или факсимильными аппаратами. Современные системы обмена информацией, поддерживающие цифровые ли­нии связи, умеют распознавать фак­симильный обмен и передают соответ­ствующие сигналы непосредственно в цифровом виде, не преобразуя их в ау­диосигнал.

Нелинейный 15-уровневый адаптивный квантователь используется для квантования разностного сигна­ла . Перед квантованием сигнал  логарифмируется по основанию 2 и масштабируются посредством коэф­фициента , который вычисляется с помощью блока адаптации масштаб­ного коэффициента.

Для определения квантованного уровня используются четыре дво­ичных символа (три для амплитуды и один для знака). Четырехбитовый вы­ход квантователя  образует выход­ной цифровой сигнал со скоростью 32 кбит/с, который одновременно подает­ся на инверсный адаптивный кванто­ватель и блок управления скоростью адаптации масштабного коэффициента квантователя.

Квантованная версия разностного сигнала формируется путем мас­штабирования с использованием спе­циальной величины , выделяемой из нормализованной характеристики квантователя, и дальнейшей транс­формации результата из логарифмиче­ского представления.

Блок адаптации масштабного ко­эффициента квантователя вычисляет  — масштабный коэффициент для квантователя и инверсного квантовате­ля. На его входы подаются четырехби­товые выходные сигналы квантователя  и параметр управления скоростью адаптации .

Основной принцип, реализуемый при масштабировании, заключается в бимодальной адаптации:

быстрой – для сигналов (напри­мер, речевых), которые дают разност­ные сигналы с большими флуктуациями;

–медленной для сигналов (например, данных в диапазоне тональ­ных частот, тонов), которые дают разностные сигналы с малыми флуктуациями.

Управление скоростью адаптации производится с помощью комбинации быстрого и медленного масштабных коэффициентов.

Быстрый (нефиксированный) масштабный коэффициент  вычисляется рекурсивно в логарифмиче­ском представлении с основанием 2 из результирующего логарифмическо­го масштабного коэффициента:

                                                              (1.6)

Как правило,  лежит в пределах . Дискретная функция определяется таблич­ным образом. Множитель (1 – 2-5) вводит ограниченную память в процесс адаптации таким образом, что состо­яния кодера и декодера сходятся при ошибках передачи.

Медленный (фиксированный) мас­штабный коэффициент  получа­ется из  с помощью операции фильтрации нижних частот:

                                                            (1.7)

Затем быстрый и медленный мас­штабные коэффициенты объединяются для получения результирующего мас­штабного коэффициента:

                                                    (1.8)

где .

Управление скоростью адапта­ции. Предполагается, что управляю­щий параметр  может принимать значения в диапазоне [0, 1]. Для рече­вых сигналов он стремится к единице, Для сигналов, данных в диапазоне то­нальных частот и одночастотных сигналов он стремится к нулю. Величи­на коэффициента определяется мерой скорости изменения величины разност­ного сигнала.

Адаптивный предсказатель и калькулятор восстановленного сигна­ла. Первоначальная функция ада­птивного предсказателя заключается в вычислении оценки  разностного сигнала . Используются две структуры адаптивного предсказате­ля – каскад первого порядка, модели­рующий нули, и каскад второго поряд­ка, моделирующий полюсы во входном сигнале.

Детектор тона и перехода. С целью улучшения рабочих характери­стик для сигналов, поступающих с вы­ходов модемов с частотной манипуля­цией, работающих в режиме кодовых комбинаций, определен двухступенча­тый процесс декодирования. Снача­ла производится детектирование сиг­нала с ограниченной полосой (напри­мер, тона), в результате чего квантова­тель может быть переведен в быстрый режим адаптации.

Упрощенная и развернутая струк­турные схемы декодера АДНКМ при­ведены на рис. 1.6,а и 1.7,б соответ­ственно. Декодер включает схему, идентичную цепи обратной связи коде­ра, преобразователь линейной ИКМ в сигнал по законам А или μ и устрой­ство установки синхронного кодирова­ния.

Устройство установки синхрон­ного кодирования предотвращает нако­пление искажений, имеющих место при синхронном последовательном кодиро­вании (АДИКМ-ИКМ-АДИКМ, дру­гие цифровые соединения). Установ­ка синхронного кодирования достига­ется путем подстройки проходного ко­да ИКМ таким образом, чтобы попы­таться устранить искажения квантова­ния в следующем каскаде кодирования АДИКМ.

Функции основных блоков декоде­ра и кодера совпадают и поэтому ниже не рассматриваются.


Вокодеры

Вокодер (от английских слов voice – голос и coder – кодировщик) пред­ставляет собой устройство, осуще­ствляющее параметрическое компандирование речевых сигналов. Ком­прессия речевых сигналов на переда­ющем конце канала связи производит­ся в анализаторе, выделяющем из ре­чевого сигнала медленно меняющиеся составляющие, которые передаются по каналу связи в виде кодовых посылок. На приемном конце с помощью мест­ных источников сигналов, управляе­мых принятыми параметрами, синте­зируется речевой сигнал.

Работа вокодеров основана на моделировании человеческой речи с учетом ее характерных особенностей. Вместо непосредственного измерения амплитуды вокодер преобразует вход­ной сигнал в некий другой, похожий на исходный. Причем измеряемые харак­теристики речевого сигнала использу­ются для подгонки параметров в при­нятой модели речевого сигнала. Имен­но эти параметры и передаются прием­нику, который по ним восстанавливает исходный речевой сигнал. По суще­ству, речь идет о синтезе речи. Есте­ственно, что измерение искажений от­ношения сигнал/шум бесполезно для вокодеров, и, следовательно, необхо­димы другие субъективные оценки, та­кие, как средняя экспертная оценка, диагностический рифмованный тест, диагностическая оценка приемлемости и др. Вокодеры можно разделить на два класса: речеэлементные и параметри­ческие.

В речеэлементных вокодерах при передаче распознаются произне­сенные элементы речи (например, фо­немы) и передаются только их но­мера. На приеме эти элементы со­здаются по правилам речеобразования или берутся из памяти устройства. Область применения фонемных воко­деров – линии командной связи, ре­чевое управление и говорящие автома­ты информационно-справочной служ­бы. Практически в таких вокодерах происходит автоматическое распозна­вание слуховых образов, а не опреде­ление параметров речи.

В параметрических вокодерах из речевого сигнала выделяют два ти­па параметров:

параметры, характеризующие оги­бающую спектра речевого сигнала, (фильтровую функцию);

параметры, характеризующие ис­точник речевых колебаний (генератор­ную функцию), – частота основного тона, ее изменение во времени, момен­ты появления и исчезновения основно­го тона, шумового сигнала.

По этим параметрам на приеме синтезируют речь.

По принципу определения параме­тров фильтровой функции речи разли­чают вокодеры:

полосные канальные (channel);

формантные;

ортогональные;

липредеры (с линейным предска­занием речи);

гомоморфные.

В полосных вокодерах спектр речи делится на 7-20 полос (каналов) аналоговыми или цифровыми полосо­выми фильтрами. Большее число ка­налов в вокодере дает большую нату­ральность и разборчивость. С каждо­го полосового фильтра сигнал поступа­ет на детектор и фильтр низких частот с частотой среза Fcp. Таким образом, сигналы на выходе каждого канала из­меняются с частотой менее Fcp. Их пе­редача возможна в аналоговом или ци­фровом виде.

В формантных вокодерах оги­бающая спектра речи описывается комбинацией формант (резонансных частот голосового тракта). Основные параметры формант – центральная частота, амплитуда и ширина полосы частот.

В ортогональных вокодерах огибающая мгновенного спектра рас­кладывается в ряд по выбранной си­стеме ортогональных базисных функ­ций. Вычисленные коэффициенты это­го разложения передаются на прием­ную сторону. Распространение полу­чили гармонические вокодеры, исполь­зующие разложение в ряд Фурье.

Вокодеры с линейным пред­сказанием (LPC — Linear Prediction Coding, или липредеры, основаны на оригинальном математическом аппа­рате. Они получили наибольшее рас­пространение и будут ниже рассмотре­ны более подробно.

Гомоморфная обработка позво­ляет разделить генераторную и филь­тровую функции, образующие речевой сигнал.

Из-за сложности определения па­раметров генераторной функции по­явились полувокодеры (VE — Voice Excited Vocoder), в которых вместо сигналов основного тона и тон-шума используется полоса речевого сигна­ла. Полоса частот до 800. .. 1000 Гц кодируется АДИКМ, АДМ (адаптивная дельта модуляция) или с помощью линейного предсказания малого порядка, а в некоторых моделях передается в аналоговом виде. Известны разные типы полувокодеров-липредеров: VELP — Vo