Skip to content

Речник на техническите термини

Този речник обяснява ключови технически термини, използвани в ръководствата, за да помогне на новодошлите да разберат терминологията:

  • ASR (Автоматично разпознаване на реч): Технология, която преобразува говоримия език в писмен текст; използва се за транскрибиране на аудио данни.
  • Batch Size (Размер на партидата): Броят на примерите за обучение, обработвани заедно в един прав/обратен проход; влияе на скоростта на обучение и използването на паметта.
  • Checkpoint (Контролна точка): Запазен моментен снимка на теглата на модела по време на или след обучение, позволяващ ви да възобновите обучението или да използвате модела за извеждане.
  • CUDA: Паралелната изчислителна платформа на NVIDIA, която позволява GPU ускорение за задачи за дълбоко обучение.
  • dBFS (Децибели спрямо пълната скала): Единица за измерване на аудио нивата в цифрови системи, където 0 dBFS представлява максимално възможното ниво.
  • Diffusion Models (Дифузионни модели): Клас генеративни модели, които постепенно добавят и след това премахват шум от данните; някои съвременни TTS системи използват този подход.
  • FFT (Бърза трансформация на Фурие): Алгоритъм, който преобразува сигнали от времевата област в представяния в честотната област; фундаментален за обработка на аудио.
  • Fine-tuning (Фина настройка): Процесът на вземане на предварително обучен модел и допълнителното му обучение върху по-малък, специфичен набор от данни, за да го адаптирате към нов глас или език.
  • LUFS (Единици на силата на звука спрямо пълната скала): Стандартизирано измерване на възприеманата сила на звука, по-представително за човешкия слух от измерванията на пиковете.
  • Manifest File (Манифест файл): Текстов файл, който изброява аудио файлове и съответните им транскрипции, използван за да каже на скрипта за обучение къде да намери данните.
  • Mel Spectrogram (Мел спектрограма): Визуално представяне на аудио, което приближава човешкото слухово възприятие чрез използване на мел скалата; често използвано като междинно представяне в TTS системите.
  • Overfitting (Преобучение): Когато модел научава данните за обучение твърде добре, включително техния шум и изключения, което води до лошо представяне на нови данни.
  • Sampling Rate (Честота на семплиране): Броят на аудио семплите за секунда (измерва се в Hz); по-високите честоти улавят повече аудио детайли, но изискват повече пространство за съхранение и изчислителна мощност.
  • STFT (Краткосрочна трансформация на Фурие): Техника, която определя честотното съдържание на локални секции на сигнал, докато той се променя с течение на времето.
  • TTS (Text-to-Speech): Технология, която преобразува писмен текст в говорим глас.
  • Validation Loss (Загуба при валидация): Метрика, която измерва грешката на модел върху валидационен набор от данни (данни, неизползвани за обучение); помага за откриване на преобучение.
  • VRAM (Видео RAM): Памет на графична карта; моделите за дълбоко обучение и техните междинни изчисления се съхраняват тук по време на обучение.
  • Vocoder (Вокодер): Компонент в някои TTS системи, който преобразува акустични характеристики (като мел спектрограми) във вълнови форми (действително аудио).