← alle linjercarl s-s

2026 · bachelorprojekt, DTU

En model der hører hvor lyden går i stykker

Talekvalitet bliver normalt til ét tal. Sammen med David Lindahl trænede jeg en lydsprogmodel til også at sige hvad der er galt, og hvornår i klippet det sker.

min rolleBachelorprojekt skrevet sammen med David Lindahl på DTU, afleveret i 2026.

12karakter
0,193MOS-fejl (MSE)
0,883overlap med det rigtige interval
13.495træningsklip
  1. 01

    Fra ét tal til tre svar

    En score siger, at lyden er dårlig. Den siger ikke, om det er støj, forvrængning eller udfald, og heller ikke hvor. Modellen giver alle tre.

    score2,4ud af 5
    beskrivelse

    »Tydelig forvrængning og støj midt i klippet«

    hvornår2,1 til 3,4 s

    eksempel på et svar

  2. 02

    Facit fra start

    For at måle om modellen rammer rigtigt, skal man kende svaret. Så vi byggede klippene selv: et ødelagt stykke sættes ind i et rent signal, og så kender vi intervallet.

    indsat stykke, kendt start og slut
  3. 03

    Træning slår størrelse

    Uden træning rammer selv store modeller langt ved siden af. Efter finjustering ligger vores model på niveau med den artikel, vi genskabte, og under deres regressorer.

    fejl på scoren, MSE, lavere er bedre

    Qwen2-Audio uden træning1,491
    Gemini 3.1 Pro uden træning1,239
    Regressorer i artiklen0,23 til 0,27
    Vores finjusterede model0,193

    in-domain testsæt

  4. 04

    En klippe i data

    Med op til 5.105 klip gættede modellen det samme interval hver gang. Først med hele datasættet lærte den at lytte efter, hvor fejlen er.

    overlap med det rigtige interval (mIoU)

    0,09500
    0,151.000
    0,112.500
    0,185.105
    0,8813.495

    antal træningsklip

  5. 05

    Rækkefølgen tæller

    Skriver modellen tidspunktet før beskrivelsen, kollapser den. Sidst i svaret virker det, og særlige tids-tokens gør det mere præcist.

    overlap med det rigtige interval (mIoU)

    Tid først, almindelig tekst0,043
    Tid først, tids-tokens0,110
    Tid sidst, almindelig tekst0,565
    Tid sidst, tids-tokens0,883
  6. 06

    Hvad der ikke virkede

    Det ekstra justeringstrin, ALLD, gav kun en lille gevinst oven på finjusteringen og hjalp ikke den tidslige model. Og beskrivelserne er sammenlignet med genererede referencer, ikke med menneskers egne forklaringer. Og intervallerne er konstruerede, ikke fejl fra den virkelige verden.

    lærtData og outputformat flyttede mere end en smartere træningsmetode
    forbeholdGyldigt for en smal, veldefineret opgave