This is an astonishing package. Every AI voice-to-text model I've tried on "The Wire's" famous "fuck" scene [0] usually fails, because the youtube clip's audio quality is bad and it's a scene with virtually no dialogue except breathing and "Fuck". But Whisper returned impressive results [1]
[0] https://www.youtube.com/watch?v=DS6pE88Xg3s
[1]
$ yt-dlp --extract-audio --audio-format mp3 -o wire-fuck.mp3 https://www.youtube.com/watch?v=DS6pE88Xg3s
$ whisper --language en wire-fuck.mp3
[00:00.000 --> 00:02.000] Oh
[00:13.260 --> 00:15.260] Fuck
[00:15.260 --> 00:31.260] Motherfucker
[00:50.700 --> 00:52.700] Fuck
[00:52.700 --> 00:58.700] Oh
[00:58.700 --> 01:10.700] Fuck
[01:28.700 --> 01:55.900] Fuck
[02:02.340 --> 02:03.700] Motherfuck.
[02:10.220 --> 02:11.220] Oh, fuck.
[02:11.780 --> 02:12.780] Oh, fuck.
[02:25.900 --> 02:27.900] Fuck, fuck, fuck, fuck, fuck, fuck.
[02:27.900 --> 02:28.900] Motherfucker.
[02:32.900 --> 02:33.900] Oh, fuck.
[02:34.900 --> 02:35.900] Fuck.
[02:35.900 --> 02:36.900] Oh, fuck.
[02:36.900 --> 02:37.900] Oh, fuck.
[02:37.900 --> 02:38.900] Oh, fuck.
[02:48.900 --> 02:49.900] Motherfucker.
[02:53.900 --> 02:54.900] Fucking A.
[02:54.900 --> 02:56.900] Mm hmm.
[02:56.900 --> 03:12.900] Fuck.
[03:26.900 --> 03:28.900] Motherfucker.
[03:28.900 --> 03:32.900] Fuck me.
[03:58.900 --> 04:01.900] Oh.
[04:28.900 --> 04:34.900] Fuck.