En model der hører hvor lyden går i stykker
Talekvalitet bliver normalt til ét tal. Sammen med David Lindahl trænede jeg en lydsprogmodel til også at sige hvad der er galt, og hvornår i klippet det sker.
min rolleBachelorprojekt skrevet sammen med David Lindahl på DTU, afleveret i 2026.
- 01
Fra ét tal til tre svar
En score siger, at lyden er dårlig. Den siger ikke, om det er støj, forvrængning eller udfald, og heller ikke hvor. Modellen giver alle tre.
score2,4ud af 5beskrivelse»Tydelig forvrængning og støj midt i klippet«
hvornår2,1 til 3,4 seksempel på et svar
- 02
Facit fra start
For at måle om modellen rammer rigtigt, skal man kende svaret. Så vi byggede klippene selv: et ødelagt stykke sættes ind i et rent signal, og så kender vi intervallet.
- 03
Træning slår størrelse
Uden træning rammer selv store modeller langt ved siden af. Efter finjustering ligger vores model på niveau med den artikel, vi genskabte, og under deres regressorer.
- 04
En klippe i data
Med op til 5.105 klip gættede modellen det samme interval hver gang. Først med hele datasættet lærte den at lytte efter, hvor fejlen er.
overlap med det rigtige interval (mIoU)
0,095000,151.0000,112.5000,185.1050,8813.495antal træningsklip
- 05
Rækkefølgen tæller
Skriver modellen tidspunktet før beskrivelsen, kollapser den. Sidst i svaret virker det, og særlige tids-tokens gør det mere præcist.
- 06
Hvad der ikke virkede
Det ekstra justeringstrin, ALLD, gav kun en lille gevinst oven på finjusteringen og hjalp ikke den tidslige model. Og beskrivelserne er sammenlignet med genererede referencer, ikke med menneskers egne forklaringer. Og intervallerne er konstruerede, ikke fejl fra den virkelige verden.
lærtData og outputformat flyttede mere end en smartere træningsmetodeforbeholdGyldigt for en smal, veldefineret opgave