Datasættet består af resultater fra mere end 100 forskellige samtale-modeller, både open-source og lukkede og af forskellige størrelser. Spørgsmålene er stillet af danske brugere og svarer til ægte brugsscenarier. Datasættet bliver kontinuerligt opdateret i takt med at nye samtaler bliver indsamlet.
Datasættet er offentligt tilgængeligt, dog skal man acceptere brugsbetingelserne på Huggingface-siden.
Datas oprindelse: hvad er AI-Arenaen.dk?
Samtalerne indsamles ved hjælp af AI-arenaen.dk, den danske indgang til compar:IA-platformen, som er et sammenligningsværktøj for samtale-AI (en "chatbot-arena"), udviklet inden for det franske kulturministerium og tilpasset til danske brugere af Danish Foundation Models og Digitaliseringsstyrelsen. Platformens dobbelte formål er:
- At oplyse om og øge bevidstheden om mangfoldigheden af modeller, kulturelle og sproglige bias samt samtale-AI'ers miljøpåvirkning.
- At forbedre samtale-AI'er ved at offentliggøre alignment-datasæt og ved at skabe en rangering af samtale-AI-modeller (under udarbejdelse).
Platformen er bygget på compar:IA (udviklet med støtte fra Atelier numérique og AllIAnce), og er integreret i beta.gouv.fr-programmet under Den Interministerielle Digitale Direktion (DINUM). Kildekoden til AI-Arenaen er offentligt tilgængelig på GitHub.