Posts
read more
Karaoke generator
Karaoke Environment Manual

Welcome to the Karaoke Environment. This tool suite allows you to download videos from YouTube, separate vocals from instrumental music using AI models (Spleeter), generate timed lyrics/subtitles using speech recognition (Whisper), convert Traditional Chinese characters to Simplified Chinese (OpenCC), and render ready-to-sing Karaoke video files with burned-in subtitles.
📁 Environment Directory Structure
karaoke-setup.sh: Main setup script to initialize environment structure, Python virtual environment, and executables..venv/: Python Virtual Environment containing all required AI models, libraries (yt-dlp,whisper_timestamped,spleeter,opencc,tf_keras,torch), and CLI tools in.venv/bin/.songs/: Output directory storing intermediate assets (downloaded.mp4/.wav, separated vocals, generated.srtfiles).result/: Final Karaoke video outputs:result/instrumental/: Pure backing tracks + original video with subtitled lyrics.result/quarter-vocal/: Backing tracks + 25% low-volume original vocals + original video with subtitled lyrics.
mastered/: Location for finalized songs.pretrained_models/: Cache directory for pretrained stem separation and speech recognition models.
🛠️ Setup & Initialization
To initialize or reproduce this environment, run: