# Audio2Spec **Repository Path**: mantis3d/Audio2Spec ## Basic Information - **Project Name**: Audio2Spec - **Description**: A Python-based desktop tool to batch convert audio files (WAV, MP3, FLAC, etc.) into Mel-spectrogram images with a 1:1 filename mapping. - **Primary Language**: Python - **License**: Not specified - **Default Branch**: main - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-06-02 - **Last Updated**: 2026-06-02 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # Audio to Spectrogram Batch Converter (音频频谱图批量生成工具) 🚀 一个基于 Python 的桌面端工具,支持批量将音频文件(WAV, MP3, FLAC 等)转换为梅尔频谱图(Mel-spectrogram)图片,并保持文件名一一对应。非常适合用于深度学习音频分类的数据集预处理或声学分析。 --- ## ✨ 功能特点 * **📦 批量处理**:一键扫描文件夹,支持 `.wav`, `.mp3`, `.flac`, `.ogg`, `.m4a` 等主流音频格式。 * **🎨 实时预览**:在界面选择不同的颜色主题(如 viridis, magma, gray 等)时,右侧会实时显示对应的频谱图效果,方便对比。 * **⚙️ 高度自定义**: * 支持自定义图片分辨率 (DPI),满足从快速预览到学术论文配图的不同需求。 * 自动裁剪边缘,生成的图片**无坐标轴、无白边**,纯粹为特征提取而生。 * **⚡ 线程优化**:采用多线程处理机制,在批量转换大量文件时,界面绝不卡死,并有进度条实时反馈。 * **🖥️ 极简 GUI**:基于 Tkinter 打造,无需复杂的命令行操作。 --- ## 🛠️ 环境准备 在运行或二次开发前,请确保你的电脑已安装 Python 3.x,并安装以下依赖库: ```bash pip install librosa matplotlib numpy Pillow ``` --- ## 🚀 快速开始 ### 1. 准备预览素材(首次运行必看) 为了让界面能显示颜色主题的预览图,你需要先生成一批素材: * 在项目根目录下放一个名为 `sample.wav` 的简短音频。 * 运行项目中的生成素材脚本,或者确保根目录下有一个 `previews` 文件夹,里面包含不同主题的 `preview_viridis.png` 等图片。 ### 2. 启动程序 在终端中运行主程序: ```bash python audioToSpectrogram.py ``` ### 3. 设置路径 * 点击“音频所在目录”右侧的**浏览**按钮,选择你要转换的音频文件夹。 * 点击“图片保存目录”右侧的**浏览**按钮,选择你希望保存频谱图的文件夹。 ### 4. 调整参数与预览 * 在“参数设置”区可以修改图片的分辨率 (DPI)。 * 切换“颜色主题”下拉菜单,可以在右侧**实时预览**不同主题的视觉效果。 ### 5. 开始转换 点击最下方的**开始批量转换**按钮,进度条会实时显示转换进度。完成后会弹出提示框。 --- ## 📄 许可证 本项目采用 [MIT License](LICENSE) 开源许可证。你可以自由地使用、修改和分发本代码。