Options
Aufbau und Bereitstellung eines Benchmark Datensatzes für Historische Tabellen, 1750-1990
Scheltjens, Werner; Geschonke, Sebastian; Gerstner, Jan; u. a. (2026): Aufbau und Bereitstellung eines Benchmark Datensatzes für Historische Tabellen, 1750-1990, in: Bamberg: Otto-Friedrich-Universität.
Faculty/Chair:
Publisher Information:
Year of publication:
2026
Pages:
Source/Other editions:
Aufbau und Bereitstellung eines Benchmark Datensatzes für Historische Tabellen, 1750-1990, Zenodo, 2026, 1 Seite
Year of first publication:
2026
Language:
German
Abstract:
Dieses Poster beschreibt den Aufbau eines Benchmark-Datensatzes für historische Tabellen aus der Sozial- und Wirtschaftsgeschichte ab 1750. Obwohl die KI-gestützte Texterkennung historischer Drucke große Fortschritte macht, ist die automatisierte Tabellenerkennung noch immer eine offene Herausforderung. Um Tabellenseiten aufzufinden, werden Metadaten über die OAI-PMH-Schnittstelle der BSB München erfasst und die Scans mit einem Keras-Klassifikationsmodell ausgewertet. Aus über 100.000 Scans wurden so 11.995 Seiten aus 364 Büchern ausgewählt. Diese werden in Label-Studio grob und mit einem eigenen Tool fein segmentiert. Als Ground Truth dienen OCR-Ergebnisse der Anthropic API, die manuell korrigiert werden. Ziel ist ein Datensatz von rund 10.000 Tabellen, der samt Code auf GitHub und Zenodo veröffentlicht wird.
GND Keywords: ; ; ;
Buch
Digitalisierung
Tabelle
Texterkennung
Keywords:
Table Recognition
DDC Classification:
RVK Classification:
Type:
Conferenceobject
Activation date:
September 28, 2026
Permalink
https://fis.uni-bamberg.de/handle/uniba/117343