音频数据集¶

torchaudio 提供对常用、公开可用数据集的便捷访问。有关可用数据集的列表，请参阅官方文档。

import torch
import torchaudio

print(torch.__version__)
print(torchaudio.__version__)

2.10.0.dev20251013+cu126
2.8.0a0+1d65bbe

import os

import IPython

import matplotlib.pyplot as plt


_SAMPLE_DIR = "_assets"
YESNO_DATASET_PATH = os.path.join(_SAMPLE_DIR, "yes_no")
os.makedirs(YESNO_DATASET_PATH, exist_ok=True)


def plot_specgram(waveform, sample_rate, title="Spectrogram"):
    waveform = waveform.numpy()

    figure, ax = plt.subplots()
    ax.specgram(waveform[0], Fs=sample_rate)
    figure.suptitle(title)
    figure.tight_layout()

在此，我们展示了如何使用 torchaudio.datasets.YESNO 数据集。

dataset = torchaudio.datasets.YESNO(YESNO_DATASET_PATH, download=True)

8%
6%
4%
1%
9%
7%
5%
3%
1%
9%
7%
4%
2%
0%
8%
6%
4%
2%
9%
7%
5%
3%
1%
9%
7%
5%
2%
0%
8%
6%
4%
2%
0%
7%
5%
0%

i = 1
waveform, sample_rate, label = dataset[i]
plot_specgram(waveform, sample_rate, title=f"Sample {i}: {label}")
IPython.display.Audio(waveform, rate=sample_rate)

i = 3
waveform, sample_rate, label = dataset[i]
plot_specgram(waveform, sample_rate, title=f"Sample {i}: {label}")
IPython.display.Audio(waveform, rate=sample_rate)

i = 5
waveform, sample_rate, label = dataset[i]
plot_specgram(waveform, sample_rate, title=f"Sample {i}: {label}")
IPython.display.Audio(waveform, rate=sample_rate)

脚本总运行时间： ( 0 分 3.295 秒)

由 Sphinx-Gallery 生成的画廊

音频数据集¶

文档

教程

资源