Whisper Skill
Trascrizione Whisper locale che seleziona il backend e il modello in base al tuo hardware
Promosso
Cosa fa
Configura ed esegue Whisper localmente anziché tramite l'API OpenAI: rileva il tuo OS, CPU, GPU e RAM, quindi sceglie un backend (mlx-whisper, faster-whisper, whisper.cpp, whisperx, openvino) e un modello corrispondente. Fornisce esempi eseguibili per la trascrizione di file singoli e batch, il download di URL tramite yt-dlp, la diarizzazione degli oratori, la dettatura vocale push-to-talk e l'incorporazione di sottotitoli in stile CapCut in MP4. Si attiva su richieste di trascrizione audio o video localmente, generazione di sottotitoli per shorts e reels, speech-to-text senza chiave API, o per sostituire strumenti di dettatura in stile Superwhisper.
Rapporto di test
Ha trascritto lo stesso clip di 10 secondi in due modi su un Mac M3: il percorso ingenuo senza skill (pip install openai-whisper, whisper sample.wav --model small) ha impiegato 5m44s su CPU e ha restituito 'That week Brown Fox jumped over the lazy dog, whispered transcription benchmark's major word error rate' - 6 parole errate su 26, circa 23% WER. Seguendo la skill, il suo rilevatore ha letto correttamente la macchina come Apple M3 / 8 GB / Metal e ha instradato a mlx-whisper su MPS, e il suo script di esempio ha restituito una trascrizione perfetta con cue SRT puliti in 3m35s, incluso il download del modello. Un vero bug: examples/common.py costruisce l'ID del repo MLX come mlx-community/whisper-<model>, quindi il modello che il suo rilevatore raccomanda (--model small) fallisce con un 404, e devi passare mlx-community/whisper-small-mlx manualmente. Tre link nel corpo (docs/word-level-subs.md, methodology/post-processing.md, examples/burn_subs.py) puntano a file che non sono mai stati committati.
Testato il: 2026-07-28 · Claude Code 2.x (agent harness)
Installazione
git clone https://github.com/Mobiss11/Whisper-Skill.git ~/.claude/skills/whisper-skill
Comandi e prompt di esempio
/whisper-skillTrascrizione Whisper locale che seleziona il backend e il modello in base al tuo hardware
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Transcribe this podcast episode locally without using the OpenAI APIBurn TikTok-style subtitles into my reel from this MP4 clipI want a free Superwhisper-style dictation tool for my Mac