Syntetiske tekstbilder for nord-, sør-, lule- og inaresamisk
Dette datasettet inneholder syntetiske linjebilder som kan brukes til å finjustere OCR-modeller for nord-, sør-, lule- og inaresamisk. Fremgangsmåten for å lage disse bildene er å lage ‘rene’ linjebilder og tilføre støy ved hjelp av Augraphy.
Teksten i datasettet kommer fra Giellatekno sitt korpus.
Datasettet er tilfeldig delt opp slik at 71% av filene (307387 linjer) er i treningsdelen, 9% av filene (40765 linjer) er i valideringsdelen og 20% av filene er i (84534 linjer) testdelen. Hver del har en unik mengde skrifttyper og tekst- og bakgrunnsfarger.
Se dokumentasjonsfilen for mer informasjon.
Dette datasettet inneholder syntetiske linjebilder som kan brukes til å finjustere OCR-modeller for nord-, sør-, lule- og inaresamisk. Fremgangsmåten for å lage disse bildene er å lage ‘rene’ linjebilder og tilføre støy ved hjelp av Augraphy.
Teksten i datasettet kommer fra Giellatekno sitt korpus.
Datasettet er tilfeldig delt opp slik at 71% av filene (307387 linjer) er i treningsdelen, 9% av filene (40765 linjer) er i valideringsdelen og 20% av filene er i (84534 linjer) testdelen. Hver del har en unik mengde skrifttyper og tekst- og bakgrunnsfarger.
Syntetiske tekstbilder for nord-, sør-, lule- og inaresamisk
dc:identifier
oai:nb.no:sbr-101
dc:description
Dette datasettet inneholder syntetiske linjebilder som kan brukes til å finjustere OCR-modeller for nord-, sør-, lule- og inaresamisk. Fremgangsmåten for å lage disse bildene er å lage 'rene' linjebilder og tilføre støy ved hjelp av Augraphy.
Teksten i datasettet kommer fra Giellatekno sitt korpus.
Datasettet er tilfeldig delt opp slik at 71% av filene (307387 linjer) er i treningsdelen, 9% av filene (40765 linjer) er i valideringsdelen og 20% av filene er i (84534 linjer) testdelen. Hver del har en unik mengde skrifttyper og tekst- og bakgrunnsfarger.
Se dokumentasjonsfilen for mer informasjon.