cd UltraEval-Audio
conda create -n aduioeval python=3.10 -y
conda activate aduioeval
pip install -r requirements.txtexport PYTHONPATH=$PWD:$PYTHONPATH
# qwen2-audio-offline test
pip install -r requirements-offline-model.txt
CUDA_VISIBLE_DEVICES=0 python audio_evals/main.py --dataset sample --model qwen2-audio-chat
Result files after test:
```txt
- res
|-- $model-name
|-- $dataset
|-- $time.jsonl
|-- $time-overview.jsonlTest Commands:
python audio_evals/main.py --dataset <dataset_name> --model <model_name> --config_path <config_path>
python audio_evals/main.py --dataset <dataset_name> --model <model_name> --config_path <config_path> --debug_mode <debug_mode> --limit <#sample_to_test>Use detailed path for--config_path, e.g., audio_eval/external_code/scripts/DyCoke/qwen2_temporal_prune_50.yml, For quick test evaluation, tedlium-release1 for ASR/STT task, mmau-test-mini for audio understanding QA task.
--dataset to specify datasets, supported datasets:
speech-chatbot-alpaca-evalllama-questionsspeech-web-questionsspeech-triviaqatedlium-release1tedlium-release2tedlium-release3catdogaudiocapscovost2-en-arcovost2-en-cacovost2-en-cycovost2-en-decovost2-en-etcovost2-en-facovost2-en-idcovost2-en-jacovost2-en-lvcovost2-en-mncovost2-en-slcovost2-en-svcovost2-en-tacovost2-en-trcovost2-en-zhcovost2-zh-encovost2-it-encovost2-fr-encovost2-es-encovost2-de-enGTZANTESSnsynthmeld-emomeld-sentimentclotho-aqaravdess-emoravdess-genderCOVID-recognizerrespiratory-cracklesrespiratory-wheezesKeSpeechaudio-MNISTlibrispeech-test-cleanlibrispeech-dev-cleanlibrispeech-test-otherlibrispeech-dev-othermls_dutchmls_frenchmls_germanmls_italianmls_polishmls_portuguesemls_spanishheartbeat_soundvocalsoundfleurs-zhvoxceleb1voxceleb2chord-recognitionwavcaps-audiosetwavcaps-freesoundwavcaps-soundbibleair-foundationair-chatdesedpeoples-speechWenetSpeech-test-meetingWenetSpeech-test-netgigaspeechaishell-1cv-15-encv-15-zhcv-15-frcv-15-yue
| <dataset_name> | name | task | domain | metric |
|---|---|---|---|---|
| speech-chatbot-alpaca-eval | speech-chatbot-alpaca-eval | SpeechQA | speech2speech | GPT-score |
| llama-questions | llama-questions | SpeechQA | speech2speech | acc |
| speech-web-questions | speech-web-questions | SpeechQA | speech2speech | acc |
| speech-triviaqa | speech-triviaqa | SpeechQA | speech2speech | acc |
| tedlium-* | tedlium | ASR(Automatic Speech Recognition) | speech | wer |
| clotho-aqa | ClothoAQA | AQA(AudioQA) | sound | acc |
| catdog | catdog | AQA | sound | acc |
| mls-* | multilingual_librispeech | ASR | speech | wer |
| KeSpeech | KeSpeech | ASR | speech | cer |
| librispeech-* | librispeech | ASR | speech | wer |
| fleurs-* | FLEURS | ASR | speech | wer |
| aishell-1 | AISHELL-1 | ASR | speech | wer |
| WenetSpeech-* | WenetSpeech | ASR | speech | wer |
| covost2-* | covost2 | STT(Speech Text Translation) | speech | BLEU |
| GTZAN | GTZAN | MQA(MusicQA) | music | acc |
| TESS | TESS | EMO(emotional recognition) | speech | acc |
| nsynth | nsynth | MQA | music | acc |
| meld-emo | meld | EMO | speech | acc |
| meld-sentiment | meld | SEN(sentiment recognition) | speech | acc |
| ravdess-emo | ravdess | EMO | speech | acc |
| ravdess-gender | ravdess | GEND(gender recognition) | speech | acc |
| COVID-recognizer | COVID | MedicineCls | medicine | acc |
| respiratory-* | respiratory | MedicineCls | medicine | acc |
| audio-MNIST | audio-MNIST | AQA | speech | acc |
| heartbeat_sound | heartbeat | MedicineCls | medicine | acc |
| vocalsound | vocalsound | MedicineCls | medicine | acc |
| voxceleb* | voxceleb | GEND | speech | acc |
| chord-recognition | chord | MQA | music | acc |
| wavcaps-* | wavcaps | AC(AudioCaption) | sound | acc |
| air-foundation | AIR-BENCH | AC,GEND,MQA,EMO | sound,music,speech | acc |
| air-chat | AIR-BENCH | AC,GEND,MQA,EMO | sound,music,speech | GPT4-score |
| desed | desed | AQA | sound | acc |
| peoples-speech | peoples-speech | ASR | speech | wer |
| gigaspeech | gigaspeech | ASR | speech | wer |
| cv-15-* | common voice 15 | ASR | speech | wer |
Build up your own dataset: docs/how add a dataset.md