Tilbake til katalogen
N-gram

N-grammer fra NBdigital 2022

Dette korpuset inneholder n-grammer – uni-, bi- og trigrammer – fra alle bøker og aviser som var blitt digitalisert ved Nasjonalbiblioteket per 15. juli 2022. N-grammene er laget på basis av et materiale bestående av om lag 610.000 bøker og 4.000.000 avishefter, til sammen ca. 138,5 milliarder "tokens" (ord og tegnsetting). Filformatet er UTF-8-kodert CSV. Kolonnene i CSV-filene med n-grammer er som følger: - first - det første ordet i n-grammet (i uni-, bi- og trigram) - second - det andre ordet i n-grammet (i bi- og trigram) - third - det tredje ordet i n-grammet (i trigram) - lang - språkkode for n-grammet (gjelder kun bøker, avisene har ingen språkklassifikasjon per nå) - freq - den totale frekvensen for n-grammet i samlingen av bøker eller aviser - json - et dictionary med råfrekvens per år totals.json inneholder totalfrekvenser innenfor årganger i hhv. bok- og avismaterialet. Med disse kan man lett regne ut relativfrekvenser for sammenligning på tvers av år som i NB N-gram. metadata-digibok.csv og metadata-digavis.csv inneholder enkle metadata for alle bøkene og avisene som inngår i bok- og aviskorpuset. Hvis du er interessert i mer utførlige metadata, henviser vi til Oria eller NBs APIer under https://api.nb.no/. Se dokumentasjonsfilene for mer informasjon.

Dokumentasjon

N-grammer fra NBdigital

Beskrivelse

Dette korpuset inneholder n-grammer - unigrammer, bigrammer og trigrammer - fra alle bøker og aviser som var blitt digitalisert ved Nasjonalbiblioteket per juli 2022. De er laget på basis av et material på om lag 610.000 bøker og 4.000.000 aviser. N-grammene finnes på CSV-format (utf8-kodert).

Innhold

Kolonnene i CSV-filene med n-grammer er som følger: first - det første ordet i n-grammet (i unigram, bigram og trigram) second - det andre ordet i n-grammet (i bigram og trigram) third - det tredje ordet i n-grammet (i trigram) lang - språkkode for n-grammet (bare i bøker, aviser har ingen språkklassifikasjon per nå) freq - den totale frekvensen for n-grammet i samlingen av bøker eller aviser json - et dictionary med råfrekvens per år

totals.json inneholder totalfrekvenser innenfor årganger i bok- og aviskorpuset. Med disse kan man lett regne ut relativfrekvenser for sammenlikning på tvers av år som i NB N-gram.

metadata-digibok.csv og metadata-digavis.csv inneholder enkle metadata for alle bøkene og avisene som inngår i bok- og aviskorpuset. Hvis du er interessert i mer utførlige metadata, henviser vi til Oria eller NBs APIer under https://api.nb.no/.

Prosessering

N-grammene ble ekstrahert fra fulltekstbasene fra DH-labben ved Nasjonalbiblioteket (https://www.nb.no/dh-lab/). Følgende frekvenskutt ble gjennomført:

  • unigram (bøker): totalfrekvens på mindre enn fem i delkorpuset for norsk bokmål, mindre enn to i alle andre språk. I tillegg må n-grammet være brukt i mer enn ett år.
  • unigram (aviser): totalfrekvens på mindre enn fem. I tillegg må n-grammet være brukt i mer enn ett år.
  • bigram (bøker og aviser): begge unigrammene i bigrammet må være et unigram etter kuttreglene ovenfor. Ellers gjelder de samme reglene som for unigrammene.
  • trigram (bøker og aviser): begge bigrammene i trigrammet må være et bigram etter kuttreglene ovenfor. I tillegg ble alle hapax-trigrammer innenfor ett år fjernet. Ellers gjelder de samme reglene som for unigrammene.

Lisens

Dataene stilles til disposisjon som CC-0 (fritt tilgjengelig).