Skip to main content

Folketingets dokumenter - træningsdata

Datasættet består af omkring 125000 dokumenter fra Folketingets arkiv (1849-2026): En lang række dokumenter produceret af Folketinget og Landstinget (1849-2008) - digitaliseret med OCR. Derefter en lang række digitale dokumenter fra Folketinget (2004-2026). Tilsammen indeholder datasættet næsten 1,2 milliarder ord.

Datasættet er skabt i et samarbejde mellem Folketinget og Rigsarkivet, men defineret af Digitaliseringsstyrelsen med henblik på træning af danske sprogmodeller og forskning.

En del af dokumenterne er digital-fødte tekster (lovforslag, beslutningsforslag, folketingsreferater og §20-spørgsmål), mens en anden del af dokumenterne er digitaliseret via OCR-skanning (trykte tekster fra perioden 1849-2008). Det har ikke været muligt at skaffe maskinproducerede OCR-konfidenstal til at beskrive OCR-kvaliteten.

OCR-kvaliteten vurderes ved øjesyn at variere markant med materialets udgivelsestidspunkt. Materiale fra det 19. og det tidlige 20. århundrede, der primært er sat med ældre (herunder gotisk) typografi, er præget af betydelige OCR-unøjagtigheder: fejllæste tegn, fragmenteret tegnsætning, samt forekomster af 홢-pladsholdertegn dér, hvor det enkelte tegn ikke har kunnet identificeres. I den tidlige periode anvendtes desuden meget tyndt papir, hvilket gav udfordringer med gennemlysning under indscanningen. I løbet af det 20. århundrede forbedres kvaliteten gradvist, og materiale fra omkring 1970'erne og frem fremstår overvejende som læselig og semantisk sammenhængende tekst, om end titler og overskrifter fortsat kan optræde fragmenteret.

Folketingets arkiv opbevarer originalindscanningerne i tiff-format.

OCR-teksterne er videreført i den form, hvori de er modtaget fra leverandøren. I nærværende tekstdataindsamling er der ikke foretaget efterbehandling med henblik på fejlrensning.

Alle tekster (både nye og gamle) er dog efterbehandet på anden vis: De er pseudonymiseret. Det betyder, at personnavne og andre personrelaterbare oplysninger er forsøgt erstattet med fiktive værdier, så enkeltpersoner ikke umiddelbart kan genkendes i teksten. Pseudonymiseringen er ikke fuldstændig - det må forventes, at nogle navne og oplysninger ikke er blevet identificeret - men det vurderes, at en betydelig del af de personidentificerende værdier er detekteret og erstattet. Erstatningerne er konsistente, så det samme navn altid bliver erstattet med den samme fiktive værdi på tværs af hele datasættet.

Teksterne er skrevet på dansk.

Datasættet er i parquet-format.

Data og ressourcer

Nøgleord

Yderligere info

URI https://data.gov.dk/dataset/lang/10.5279/dk-ra-14004
Destinationsside https://digidata.rigsarkivet.dk/aflevering/14004
Høstes af Datavejviser Ja
Udgivelsesdato 13-08-2026
Seneste ændringsdato 13-08-2026
Opdateringsfrekvens aldrig
Dækningsperiode 01-01-1849  /  01-05-2026
Emne(r) Regeringen og den offentlige sektor
Adgangsrettigheder offentlig
Overholder
Proveniensudsagn

Samlingerne der findes på ft.dk indeholder dokumenter, der stammer fra lovgivningsprocessen i bredeste forstand, og tæller heriblandt fremsatte forslag, betænkninger og vedtagne forslag.

Dokumentation