Views
No views yet
pip install git+https://github.com/Deep-unlearning/transformers.git@add-xcodec21>>> import torch
2>>> from datasets import Audio, load_dataset
3>>> from transformers import AutoFeatureExtractor, Xcodec2Model
4
5>>> torch_device = "cuda" if torch.cuda.is_available() else "cpu"
6
7>>> # load model and feature extractor
8>>> model_id = "hf-audio/xcodec2"
9>>> model = Xcodec2Model.from_pretrained(model_id).to(torch_device).eval()
10>>> feature_extractor = AutoFeatureExtractor.from_pretrained(model_id)
11
12>>> # load data
13>>> dataset = load_dataset("hf-internal-testing/librispeech_asr_dummy", "clean", split="validation")
14>>> dataset = dataset.cast_column("audio", Audio(sampling_rate=feature_extractor.sampling_rate))
15>>> audio = dataset[0]["audio"]["array"]
16
17>>> # prepare data
18>>> inputs = feature_extractor(audio=audio, sampling_rate=feature_extractor.sampling_rate, return_tensors="pt").to(torch_device)
19
20>>> # encoder and decode
21>>> audio_codes = model.encode(**inputs).audio_codes
22>>> audio_values = model.decode(audio_codes).audio_values
23>>> # or the equivalent with a forward pass
24>>> model_output = model(**inputs)
25>>> audio_codes = model_output.audio_codes
26>>> audio_values = model_output.audio_values