Wie man Dokumentstruktur mit Parsers in Python extrahiert
Wie man Dokumentstruktur mit Parsers extrahiert
Aspose.Words FOSS für Python bietet Parser-Klassen zur Ausnahme strukturierter Daten aus DOCX Dokumente. NumberingParser für die Liste Nummern und StyleParser für Dokumentenstile.
Prerequisites
Installation der Bibliothek:
pip install aspose-words-foss>=26.4.0Python 3.10 oder höher.
Nummerierung Parser
NumberingParser Lesen Sie die Liste der Nummerierung Definitionen aus einem DOCX-Paket. Nach Anrufen parse_numbering_part(),Sie können die Liste der Eigenschaften fragen:
NumberingParser.get_list_info()— Informationen über eine bestimmte Liste durch ihre ID erhaltenNumberingParser.is_ordered_list()- prüfen, ob ein Liste-Level bestellt oder geschossen wirdNumberingParser.get_start_value()- Erhalten Sie die Startnummer für eine Liste-LevelNumberingParser.get_delimiter()— die Delimitärstring für eine Liste-Level erhalten
Stil Parzer
StyleParser Styling-Namen in strukturiert ParsedStyle Objekte, die Titel identifizieren, Blockquotes, Codeblöcke und Listeparagrafen:
StyleParser.parse()- ein Stilname in eineParsedStyleObjektStyleParser.get_style_chain()- eine Kette von Stilnamen für erbe Stile zu verfeinernStyleParser.is_setext_heading()- prüfen, ob ein Stil eine Setext-Stil-Heading istStyleParser.extract_all_styles()— die einzelnen Stilnamen aus einer comma-separierten Kette extrahieren
Datensatzmodell
Parsed-Nummerdaten werden in strukturierten Objekten gespeichert:
| Class | Schlüssel Eigenschaften |
|---|---|
NumberingInfo | num_id, abstract_num_id, levels |
NumberingLevel | format, start, text |
Zusammenfassung
| Parser | Purpose |
|---|---|
NumberingParser | Extrakt Liste Nummerierung Definitionen |
StyleParser | Parse-Stilnamen in strukturierte Informationen |