Views
No views yet

felguk-audio.box — это мощная модель для обработки аудиоданных, разработанная для задач классификации, генерации и анализа звуковых сигналов. Модель основана на архитектуре Transformer и обучена на большом наборе аудиоданных, что позволяет ей эффективно работать с различными типами звуков, включая музыку, речь и окружающие шумы.| Характеристика | Значение |
|---|---|
| Архитектура | Transformer-based |
| Задачи | Классификация аудио, генерация звука, анализ звуковых сигналов |
| Поддерживаемые типы аудио | Музыка, речь, окружающие шумы |
| Обучение | Предварительно обучена на большом наборе аудиоданных |
| Размер модели | 300M параметров |
| Язык | Многоязычная поддержка (английский, русский, другие языки) |
| Лицензия | Apache 2.0 |
felguk-audio.box поддерживает обработку длинных аудиофайлов путем разбиения их на чанки (фрагменты). Это особенно полезно для задач, где входные аудиофайлы могут быть продолжительными (например, подкасты, лекции или музыкальные композиции).1import torchaudio
2from transformers import AutoModelForAudioClassification, AutoFeatureExtractor
3
4# Загрузка модели и feature extractor
5model_name = "felguk-audio.box"
6model = AutoModelForAudioClassification.from_pretrained(model_name)
7feature_extractor = AutoFeatureExtractor.from_pretrained(model_name)
8
9# Функция для разбиения аудио на чанки
10def split_audio(waveform, sample_rate, chunk_length=10, overlap=2):
11 chunk_size = int(chunk_length * sample_rate)
12 step_size = int((chunk_length - overlap) * sample_rate)
13 chunks = []
14 for i in range(0, waveform.shape[1], step_size):
15 chunk = waveform[:, i:i + chunk_size]
16 if chunk.shape[1] < chunk_size:
17 # Дополнение последнего чанка, если он короче
18 padding = torch.zeros((1, chunk_size - chunk.shape[1]))
19 chunk = torch.cat([chunk, padding], dim=1)
20 chunks.append(chunk)
21 return chunks
22
23# Загрузка аудиофайла
24audio_file = "long_audio.wav"
25waveform, sample_rate = torchaudio.load(audio_file)
26
27# Разбиение на чанки
28chunks = split_audio(waveform, sample_rate, chunk_length=10, overlap=2)
29
30# Обработка каждого чанка
31results = []
32for chunk in chunks:
33 inputs = feature_extractor(chunk.squeeze().numpy(), sampling_rate=sample_rate, return_tensors="pt")
34 with torch.no_grad():
35 logits = model(**inputs).logits
36 predicted_class_idx = logits.argmax(-1).item()
37 results.append(model.config.id2label[predicted_class_idx])
38
39# Агрегация результатов (например, голосование)
40from collections import Counter
41final_result = Counter(results).most_common(1)[0][0]
42print(f"Final classification result: {final_result}")felguk-audio.box в вашем проекте, выполните следующие шаги:pip install torch transformers datasets1from transformers import AutoModelForAudioClassification, AutoFeatureExtractor
2import torchaudio
3
4# Загрузка модели и feature extractor
5model_name = "felguk-audio.box"
6model = AutoModelForAudioClassification.from_pretrained(model_name)
7feature_extractor = AutoFeatureExtractor.from_pretrained(model_name)
8
9# Загрузка аудиофайла
10audio_file = "path_to_your_audio_file.wav"
11waveform, sample_rate = torchaudio.load(audio_file)
12
13# Преобразование аудио в формат, подходящий для модели
14inputs = feature_extractor(waveform.squeeze().numpy(), sampling_rate=sample_rate, return_tensors="pt")
15
16# Получение предсказаний
17with torch.no_grad():
18 logits = model(**inputs).logits
19
20# Интерпретация результатов
21predicted_class_idx = logits.argmax(-1).item()
22print(f"Predicted class: {model.config.id2label[predicted_class_idx]}")1# Пример классификации аудио
2audio_file = "example.wav"
3waveform, sample_rate = torchaudio.load(audio_file)
4
5inputs = feature_extractor(waveform.squeeze().numpy(), sampling_rate=sample_rate, return_tensors="pt")
6
7with torch.no_grad():
8 logits = model(**inputs).logits
9
10predicted_class_idx = logits.argmax(-1).item()
11print(f"Predicted class: {model.config.id2label[predicted_class_idx]}")1from datasets import load_dataset
2from transformers import Trainer, TrainingArguments
3
4# Загрузка датасета
5dataset = load_dataset("your_audio_dataset")
6
7# Определение TrainingArguments
8training_args = TrainingArguments(
9 output_dir="./results",
10 evaluation_strategy="epoch",
11 learning_rate=2e-5,
12 per_device_train_batch_size=8,
13 per_device_eval_batch_size=8,
14 num_train_epochs=3,
15 weight_decay=0.01,
16)
17
18# Инициализация Trainer
19trainer = Trainer(
20 model=model,
21 args=training_args,
22 train_dataset=dataset["train"],
23 eval_dataset=dataset["test"],
24)
25
26# Обучение модели
27trainer.train()felguk-audio.box в Hugging Face Spaces с помощью Gradio или Streamlit. Вот пошаговое руководство:pip install gradio1import gradio as gr
2from transformers import AutoModelForAudioClassification, AutoFeatureExtractor
3import torchaudio
4
5# Загрузка модели и feature extractor
6model_name = "felguk-audio.box"
7model = AutoModelForAudioClassification.from_pretrained(model_name)
8feature_extractor = AutoFeatureExtractor.from_pretrained(model_name)
9
10# Функция для классификации аудио
11def classify_audio(audio_file):
12 waveform, sample_rate = torchaudio.load(audio_file)
13 inputs = feature_extractor(waveform.squeeze().numpy(), sampling_rate=sample_rate, return_tensors="pt")
14 with torch.no_grad():
15 logits = model(**inputs).logits
16 predicted_class_idx = logits.argmax(-1).item()
17 return model.config.id2label[predicted_class_idx]
18
19# Создание интерфейса Gradio
20interface = gr.Interface(
21 fn=classify_audio,
22 inputs=gr.Audio(type="filepath"),
23 outputs="text",
24 title="felguk-audio.box: Audio Classification",
25 description="Upload an audio file to classify it using the felguk-audio.box model."
26)
27
28# Запуск интерфейса
29interface.launch()1torch
2torchaudio
3transformers
4gradio1import gradio as gr
2
3# Загрузка модели через Hugging Face
4model_interface = gr.load(
5 "models/felguk-audio.box", # Укажите путь к вашей модели
6 title="felguk-audio.box: Audio Classification",
7 description="Upload an audio file to classify it using the felguk-audio.box model."
8)
9
10# Запуск интерфейса
11model_interface.launch()felguk-audio.box в LM Studio, выполните следующие шаги:felguk-audio.box доступна в формате GGUF. Если модель еще не конвертирована, используйте инструменты, такие как llama.cpp, для конвертации.felguk-audio.box.gguf) на ваш компьютер.felguk-audio.box.gguf.felguk-audio.box из списка.llama.cpp.felguk-audio.box локально через LM Studio! 🚀