Fragen Sie sich auch manchmal, was die Menschen vor zweihundert Jahren beschäftigte? Welche Themen trieben sie um, womit verbrachten sie ihre Freizeit und worüber wurde in Ratgebern und Führern geschrieben? Gab es damals schon Reiseführer für Touristen, Zusammenstellungen der schönsten Schweizer Wanderungen oder «Fitness-Tutorials» mit Instruktionen zu den neuesten Turnübungen?

Die Antwort lautet «ja». Diesen und vielen weiteren Fragen können Sie im neuen Rechercheportal Books as Data auf den Grund gehen. Das Portal präsentiert seit dem 24. September 2026 allen Interessierten eine grosse Auswahl an Drucken aus dem Zeitraum 1700 – 1900. Das Projekt wird von den Universitätsbibliotheken Bern und Basel, der Zentralbibliothek Zürich und der Zentral- und Hochschulbibliothek Luzern getragen.


Doch wie durchsucht man einen solch grossen Bestand mit 750'000 Exemplaren effizient, um gezielt Fitness-, Reise- oder Wanderführer zu finden? Oft läuft die Suche nach interessanten Werken wie in unserem Fall nicht über Titel und Autor, sondern über Genres. Doch genau diese Genre-Bezeichnungen fehlten für die Mehrheit der historischen Drucke auf Books as Data. 

Um die Suche nach Literaturgattungen dennoch zu ermöglichen, entwickelte das ZB-Lab ein eigenes KI-Modell, das die Werke automatisch einem Genre zuordnete. Das Modell wurde auf den vorhandenen Genre-Kategorien trainiert und war auf historische Schweizer Drucke spezialisiert. Dadurch lassen sich tausende bisher schwer auffindbare Werke erstmals gezielt nach Literaturgattungen durchsuchen.

Hinter diesem neuen Zugang zu historischen Drucken steckt jedoch nicht nur ein KI-Projekt des ZB-Labs, sondern auch eine enge institutionsübergreifende und interdisziplinäre Zusammenarbeit. Denn während das ZB-Lab an den Modellen und den zu vergebenden Labels schraubte, entwickelte die UB Basel die Plattform und die Datenbanken weiter. Wir räumten sozusagen das Gewürzregal ein, während rundherum das Haus überhaupt erst gebaut wurde. Dass das Projekt zu einem erfolgreichen Abschluss kam, ist speziell der gelungenen Kooperation zwischen den Entwickler*innen, Portalbetreibern, Fachspezialist*innen und Bibliothekar*innen zu verdanken.

«Bilderbuch», «Jugendsachbuch» oder doch «Kinder- und Jugendbücher»?

Wie wichtig der interdisziplinäre Austausch war, zeigte sich gleich zu Beginn des Projekts. Bevor das ZB-Lab ein Modell trainieren konnte, das jedem Werk auf der Plattform ein Genre zuordnete, musste geklärt werden, was überhaupt annotiert werden sollte. Welche Genre-Kategorien sollte das Modell vergeben und nach welchen bibliothekarischen Standards?

Die Entscheidung wurde teilweise durch die vorhandenen Daten geleitet: Rund ein Siebtel der Werke (also ca. 100'000) hatte bereits ein Genre-Label, das von Bibliothekar*innen vergeben worden war.

Insgesamt fanden wir 143 verschiedene Genres in den Daten vor – zu viele, als dass ein Modell sie zuverlässig auseinanderhalten und vorhersagen kann. Zudem waren die Daten sehr ungleich auf die Kategorien verteilt: Während drei Viertel der annotierten Werke auf das Genre «Hochschulschrift» entfielen, kam der Grossteil der restlichen Genres weniger als 100-mal in den Daten vor – zu wenig, um ein Modell darauf zu trainieren.

Die vorhandenen Kategorien mussten also in Gruppen zusammengefasst werden, um ein überschaubares Labelsystem zu erhalten, das zwei entgegenlaufende Forderungen erfüllte: Es sollte einfach genug sein, damit das Modell die Kategorien zuverlässig lernen konnte, aber gleichzeitig sollte es differenziert genug sein, um eine hohe Genauigkeit bei der Suche sicherzustellen.

Gemeinsam mit Bibliothekar*innen der vier Partnerbibliotheken entwickelten wir ein Genre-System mit 19 Kategorien. «Bilderbuch», «Jugendsachbuch» und «Kinderbuch» wurden zu «Kinder- und Jugendbücher» zusammengefasst, aus «Ausstellungskatalog», «Auktionskatalog» und «Antiquariatskatalog» wurde schlicht «Katalog». Diese 19 Kategorien sollte unser Modell nun lernen.

Vom Büro-Laptop zum Super-Computer

Für die technische Umsetzung unseres Vorhabens erwiesen sich die enge Zusammenarbeit und der regelmässige Austausch mit dem Entwickler-Team der UB Basel als überaus wertvoll.

Als Trainingsgrundlage verwendeten wir die gut 100'000 Werke, die bereits ein Genre-Label hatten. Für die Zusammenstellung des Datenkorpus erhielten wir Zugriff auf die Books-as-Data-Datenbank sowie tatkräftige Unterstützung durch die UB Basel.

Während des Trainings lernte unser Modell anhand der Titel vorherzusagen, zu welchem Genre ein bestimmtes Werk gehört. Dazu zeigten wir ihm rund 80'000 Beispiele aus den Daten, während die restlichen 20'000 Beispiele zur Seite gelegt und erst am Ende genutzt wurden, um zu überprüfen, wie zuverlässig unser Modell historische Drucke in Genres einteilte.

Beim Trainieren des Modells stiessen wir mit unseren Büro-Laptops schnell an Grenzen. Um mehrere Experimente durchzuführen und verschiedene Modelle zu trainieren, benötigten wir deutlich mehr Rechenpower als unsere Laptops hergaben. Durch das Kooperationsprojekt gewährte uns die Universität Basel rasch und unkompliziert Zugang zu ihrem High-Performance-Computer sciCORE, inklusive einer Schulung und Unterstützung bei Fragen und Problemen.

Auf sciCORE konnten wir innert 10 Stunden 64 Modelle mit verschiedenen Konfigurationen trainieren und am Ende das beste auswählen, um die historischen Werke einem Genre zuzuordnen. Die Ergebnisse wurden von der UB Basel ins Rechercheportal Books as Data eingespielt, wo die Labels von Fachspezialist*innen der vier Partnerinstitutionen unter die Lupe genommen wurden. Die Daten frühzeitig so zu sehen, wie sie später im Portal angezeigt werden, war unschätzbar wertvoll. Denn die technischen Metriken, die uns angeben sollten, wie gut das Modell funktionierte, deckten sich nicht unbedingt mit der erlebten User Experience. Ausserdem erhielten wir so Feedback von Fachpersonen, das wir in die Überarbeitung einfliessen lassen konnten.

Genre-Labels für historische Drucke – ein interdisziplinäres Gemeinschaftswerk

Mit diesem Projekt hat das ZB-Lab eine neue Form der Zusammenarbeit mit anderen Institutionen erprobt. Dank dem engen Austausch zwischen Entwickler*innen, den Portalbetreibern, Bibliothekar*innen und Fachspezialist*innen, einer gemeinsamen Dokumentation, geteiltem Code und dem grosszügigen Teilen von Ressourcen konnten wir gemeinsam Meilensteine erreichen, die ohne diese Verzahnung nicht möglich gewesen wären.

Das Resultat dieser Zusammenarbeit können Sie auf Books as Data unter der Facette «Genre (maschinell generiert)» erkunden. Blättern Sie sich durch Bücher in den unterschiedlichsten Sprachen, die sich seit über hundert Jahren in Schweizer Bibliotheken befinden. Tauchen Sie ein in Grafiken, Karten und andere Schätze: altägyptische Schriften inklusive Übersetzung, prächtige historische Abbildungen und Kuriositäten. Dank der neuen Genre-Labels können Sie nun auch gezielt nach Wörterbüchern, Biografien, Nachrufen auf bekannte historische Persönlichkeiten oder wie in unserem obigen Beispiel nach Führern und Handbüchern suchen. Ob Sie sich dabei mit einem Workout-Tipp aus dem 19. Jahrhundert fit halten oder sich beim nächsten Wochenendtrip mit einem 200-jährigen Reiseführer auf die historischen Spuren einer Stadt begeben, ist Ihnen überlassen.





Sarah Kiener, ZB-Lab



Header-Bild: Collage aus «Die Trinkhalle in: Weber, J.: Baden-Baden und Umgebung, Zürich 1879, S. 9» und «Wild, S.: Foto in: Das Turnen mit dem federnd-ausziehbaren Turnstab: (Sthenogene Strength-Generator): Eine Anleitung für Private und Vereine mit 18 photographischen Aufnahmen, 2. Aufl., Basel 1888, S. 9.