Scriba
Trascrizione locale di riunioni con diarizzazione dell'altoparlante (whisperX + pyannote), quindi rinomina Speaker 1/2 con nomi reali.
Richiede configurazione
Cosa fa
Trascrive una riunione audio/video in una trascrizione Markdown accurata e etichettata per altoparlante (Speaker 1/2/3) con clip vocali per altoparlante incorporate, quindi rinomina gli altoparlanti con nomi reali su richiesta. Si attiva quando l'utente rilascia un file audio/video e chiede una trascrizione, diarizzazione, o 'chi ha detto cosa' (inglese o russo).
Rapporto di test
Eseguito il vero formatter end-to-end su una trascrizione diarizzata sintetica: corretta matematica del tempo di parola 62%/38%, sezione ID altoparlante pulita con citazioni di esempio, quindi un passaggio di rinomina funzionante (Speaker 1/2 -> nomi reali) — genuinamente migliore di un rendering di baseline ingenuo. ASR + diarizzazione completi non potevano essere esercitati: necessita di `uv` (non installato qui) più un account HuggingFace gratuito e un flusso di consenso del modello con gate in 3 clic prima ancora che inizi un download di circa 3 GB, esattamente come SKILL.md stesso dichiara.
Testato il: 2026-07-15 · Claude Code 2.x (agent harness)
Installazione
git clone https://github.com/AlexanderAbramovPav/scriba mkdir -p ~/.claude/skills cp -r scriba ~/.claude/skills/scriba
Comandi e prompt di esempio
/scribaTrascrizione locale di riunioni con diarizzazione dell'altoparlante (whisperX + pyannote), quindi rinomina Speaker 1/2 con nomi reali.
Gli skill si attivano con richieste in linguaggio naturale, senza comandi da ricordare. Dopo l'installazione, prompt come questi lo attivano (in inglese):
Transcribe this meeting recording and label who said what, pleaseDiarize this audio file and then rename the speakers to their real namesI have a Zoom recording, give me a speaker-labeled transcript please