Речник на техническите термини¶
Този речник обяснява ключови технически термини, използвани в ръководствата, за да помогне на новодошлите да разберат терминологията:
- ASR (Автоматично разпознаване на реч): Технология, която преобразува говоримия език в писмен текст; използва се за транскрибиране на аудио данни.
- Batch Size (Размер на партидата): Броят на примерите за обучение, обработвани заедно в един прав/обратен проход; влияе на скоростта на обучение и използването на паметта.
- Checkpoint (Контролна точка): Запазен моментен снимка на теглата на модела по време на или след обучение, позволяващ ви да възобновите обучението или да използвате модела за извеждане.
- CUDA: Паралелната изчислителна платформа на NVIDIA, която позволява GPU ускорение за задачи за дълбоко обучение.
- dBFS (Децибели спрямо пълната скала): Единица за измерване на аудио нивата в цифрови системи, където 0 dBFS представлява максимално възможното ниво.
- Diffusion Models (Дифузионни модели): Клас генеративни модели, които постепенно добавят и след това премахват шум от данните; някои съвременни TTS системи използват този подход.
- FFT (Бърза трансформация на Фурие): Алгоритъм, който преобразува сигнали от времевата област в представяния в честотната област; фундаментален за обработка на аудио.
- Fine-tuning (Фина настройка): Процесът на вземане на предварително обучен модел и допълнителното му обучение върху по-малък, специфичен набор от данни, за да го адаптирате към нов глас или език.
- LUFS (Единици на силата на звука спрямо пълната скала): Стандартизирано измерване на възприеманата сила на звука, по-представително за човешкия слух от измерванията на пиковете.
- Manifest File (Манифест файл): Текстов файл, който изброява аудио файлове и съответните им транскрипции, използван за да каже на скрипта за обучение къде да намери данните.
- Mel Spectrogram (Мел спектрограма): Визуално представяне на аудио, което приближава човешкото слухово възприятие чрез използване на мел скалата; често използвано като междинно представяне в TTS системите.
- Overfitting (Преобучение): Когато модел научава данните за обучение твърде добре, включително техния шум и изключения, което води до лошо представяне на нови данни.
- Sampling Rate (Честота на семплиране): Броят на аудио семплите за секунда (измерва се в Hz); по-високите честоти улавят повече аудио детайли, но изискват повече пространство за съхранение и изчислителна мощност.
- STFT (Краткосрочна трансформация на Фурие): Техника, която определя честотното съдържание на локални секции на сигнал, докато той се променя с течение на времето.
- TTS (Text-to-Speech): Технология, която преобразува писмен текст в говорим глас.
- Validation Loss (Загуба при валидация): Метрика, която измерва грешката на модел върху валидационен набор от данни (данни, неизползвани за обучение); помага за откриване на преобучение.
- VRAM (Видео RAM): Памет на графична карта; моделите за дълбоко обучение и техните междинни изчисления се съхраняват тук по време на обучение.
- Vocoder (Вокодер): Компонент в някои TTS системи, който преобразува акустични характеристики (като мел спектрограми) във вълнови форми (действително аудио).