Topic Modeling und interpretative Erzählanalyse
DOI:
https://doi.org/10.21241/Schlagwörter:
Topic Modeling, Interpretative Erzählanalyse, Automatisierte Verarbeitung qualitativer Daten, ComputerlinguistikAbstract
Auf Latent Dirichlet Allocation (LDA) beruhendes Topic Modeling (Blei et al. 2003) wird eingesetzt, um Themen und lexikalisches Material in Textsammlungen zu identifizieren und Wahrscheinlichkeitsverteilungen von Wörtern und Themen in einem Korpus zu beschreiben.
Grootendorst (2022) legt mit BERTopic einen Topic-Modeling-Ansatz vor, der auf der Verortung von Wörtern, Sätzen und Abschnitten von Texten im Embedding-Raum von Transformern aufsetzt. Dem Ansatz liegt zugrunde, dass sich Textstücke ähnlich sind, wenn sie im Embedding-Raum nahe beieinanderliegen; TF-IDF erlaubt es anschließend, Wörter zu finden, die für ein Thema prominent sind.
Im Rahmen von Arbeiten zur interpretativen Analyse von Lebenslauf-Erzählungen wurde untersucht, welche Topics aus einer Kollektion von Lebenslaufbeschreibungen extrahiert werden, wenn BERTopic in einem Bottom-up-Ansatz verwendet wird, und wie sich die Topics unterscheiden, wenn Seeded Topic Modeling verwendet wird, also bestimmte aus theoretischer Sicht oder aus der vorgängigen Topic-Analyse erwartete Wörter bestimmten Topics vorgegeben werden, um die Generierung der Topics zu steuern (vgl. Kahle und Kliche 2022).
Dies eröffnete die methodische Möglichkeit eines dreifachen Vergleichs der Güte der Resultate einer humanen interpretativen Analyse, eines Bottom-up Topic Modelings und eines Seeded Topic Modelings. Im Projekt, das Textkorpora aus der soziologischen Biographieforschung, der Oral History und soziologischen Expert:innen-Interviews exploriert hat, konnten so auf qualitative (regelbasierte) und quantitative (stochastische) Weise Beurteilungen der Güte der human und maschinell vorgenommenen Klassifikationen/Interpretationen vorgenommen werden. Dabei lassen sich Fälle zeigen, in denen Ergebnisse der Topic-Modeling-Verfahren auch in regelbasierter Beurteilung interpretativ angemessene Zuordnungen lieferten bzw. auch statistisch zuverlässige Zuordnungen (z. B. gemäß Krippendorffs Alpha oder Cohens Kappa) durch humane Klassifikation aufwiesen.
References
Austin, John L. 1962. How to do Things with Words. Harvard: University Press
Biemann, Chris, Gerhard Heyer und Uwe Quasthoff. 2022. Wissensrohstoff Text. Wiesbaden: Springer.
Blei, David M., Andrew Y. Ng und Michael I. Jordan. 2003. Latent Dirichlet Allocation. The Journal of Machine Learning Research 3:993-1022
Boyd, Ryan L., Kate G. Blackburn und James W. Pennebaker. 2020. The narrative arc: Revealing core narrative structures through text analysis. Science Advances 6(32):eaba2196
Bourdieu, Pierre. 1982. Qu'est-ce que parler veut dire? Paris: Fayard.
Corsten, Michael, und Laura Maleyka. 2024. Die Präsentation der biographischen Visitenkarte: Erzählstimulus und Selbsteinführung am Interviewbeginn. BIOS – Zeitschrift für Biographieforschung, Oral History und Lebensverlaufsanalysen 37:157–181
De Saussure, Ferdinand. 1995 [1916]. Cours de linguistique générale. Paris: Payot, coll.
Eder, Maciej, Jan Rybicki, J. und Mike Kestemont. 2016. Stylometry with R: a package for computational text analysis. R Journal 8:107–121.
Fischer-Rosenthal, Wolfram, und Gabriele Rosenthal. 1997. Narrationsanalyse biographischer Selbstpräsentation. In: Sozialwissenschaftliche Hermeneutik, Hrsg. Ronald Hitzler und Anne Honer, 133–164. Opladen: Leske + Budrich.
Foucault, Michel. 1969. L’archéologie du savoir. Paris: Éditions Gallimard.
Gao, Xin, und Cem Sazara. 2023. Discovering mental health research topics with Topic Modeling. arXiv:2308.13569
Greimas, Algirdas J. 1966. Sémantique structurale. Recherche de méthode. Paris: Larousse.
Grootendorst, Marten. 2022. BERTopic: Neural topic modeling with a class-based TF-IDF procedure. arXiv:2203.05794
Habermas, Tilmann, und Elaine Reese. 2015. Getting a life takes time: The development of the life story in adolescence, its precursors and consequences. Human Development 58:172–201
Harris, Zellig. 1954. Distributional Structure. Word 10(2/3):146–162.
Jafke, Larissa, Laura Maleyka, Holger Herma, Karsten Spindler, Michael Corsten und Kathrin Audehm. 2022. Sich als Subjekt des Sprechens über das eigene Leben einführen. In: Positioning the Subject, Hrsg. Saša Bosančić, Folke Brodersen, Lisa Pfahl, Lena Schürmann, Tina Spies und Boris Traue, 115–138. Wiesbaden: Springer VS.
Kahle, Patrick, und Kliche, Fritz. 2022. Learning inductive and deductive topics in parallel using seeded topic modeling. In: Diversity of Methods and Materials in Digital Human Sciences: Proceedings of the Digital Research Data and Human Sciences DRDHum Conference 2022, December 1–3, Hrsg. Jarmo H. Jantunen, Johanna Kalja-Voima, Matti Laukkarinen, Anna Puupponen, Margareta Salonen, Tuija Saresma, Jenny Tarvainen und Sabine Ylönen, 28–42. Jyväskylä, Finland.
Kallmeyer, Werner, und Fritz Schütze. 1977. Zur Konstitution von Kommunikationsschemata der Sachverhaltsdarstellung. In: Gesprächsanalysen. Vorträge, gehalten anlässlich des 5. Kolloquiums des Instituts für Kommunikationsforschung und Phonetik, Hrsg. Dirk Wegner, 159–274. Bonn.
Küsters, Ivonne. 2021. Narrative Interviews. Wiesbaden: Springer VS.
Labov, William, und Waletzky, Joshua. 1967. Narrative analysis: Oral versions of personal experience. In: Essays on the Verbal and the Visual Arts, Hrsg. June Helm, 3–38. Seattle und London: University of Washington Press.
Lämmert, Eberhard. 1955. Bauformen des Erzählens. Stuttgart: Metzler.
Pennebaker, James W. 2011. The secret life of pronouns: What our words say about us. New York: Bloomsbury.
Schütze, Fritz. 1984. Kognitive Figuren des autobiographischen Stegreiferzählens. In: Biographie und soziale Wirklichkeit. Neue Beiträge und Forschungsperspektiven, Hrsg. Martin Kohli und Günter Robert, 70–117. Stuttgart: Metzler.
Stanzel, Franz K. 1982. Theorie des Erzählens. Göttingen: Vandenhoeck und Ruprecht.
Weber, Dietrich. 1998. Erzählliteratur. Schriftwerk – Kunstwerk – Erzählwerk. Göttingen: Vandenhoeck und Ruprecht.
Wiedemann, Gregor, und Matthias Lemke. 2016. Text Mining für die Analyse qualitativer Daten. Auf dem Weg zu einer Best Practice? In: Text Mining in den Sozialwissenschaften, Hrsg. Matthias Lemke und Gregor Wiedemann, 397–419. Wiesbaden: Springer.
Ziems, Caleb, William Held, Omar Shaikh, Jiaao Chen, Zhehao Zhang, Diyi Yang. 2024. Can Large Language Models Transform Computational Social Science? Computational Linguistics 50:237–291.
Downloads
Veröffentlicht
Ausgabe
Rubrik
License
Copyright (c) 2026 Transitionen. Verhandlungen des 42. Kongresses der Deutschen Gesellschaft für Soziologie in Duisburg 2025

This work is licensed under a Creative Commons Attribution-NonCommercial 4.0 International License.
Beiträge im Verhandlungsband des 42. Kongresses der Deutschen Gesellschaft für Soziologie in Duisburg werden unter der Creative Commons Lizenz "Namensnennung-Nicht kommerziell 4.0 International (CC BY-NC 4.0)" veröffentlicht.
Dritte dürfen die Beiträge:
-
Teilen: in jedwedem Format oder Medium vervielfältigen und weiterverbreiten
-
Bearbeiten: remixen, verändern und darauf aufbauen
unter folgenden Bedingungen:
-
Namensnennung: Dritte müssen angemessene Urheber- und Rechteangaben machen, einen Link zur Lizenz beifügen und angeben, ob Änderungen vorgenommen wurden
-
Nicht kommerziell: Dritte dürfen das Material nicht für kommerzielle Zwecke nutzen