Wie man Dokumentstruktur mit Parsers in Python extrahiert

Wie man Dokumentstruktur mit Parsers in Python extrahiert

Wie man Dokumentstruktur mit Parsers extrahiert

Aspose.Words FOSS für Python bietet Parser-Klassen zur Ausnahme strukturierter Daten aus DOCX Dokumente. NumberingParser für die Liste Nummern und StyleParser für Dokumentenstile.

Prerequisites

Installation der Bibliothek:

pip install aspose-words-foss>=26.4.0

Python 3.10 oder höher.

Nummerierung Parser

NumberingParser Lesen Sie die Liste der Nummerierung Definitionen aus einem DOCX-Paket. Nach Anrufen parse_numbering_part(),Sie können die Liste der Eigenschaften fragen:

  • NumberingParser.get_list_info() — Informationen über eine bestimmte Liste durch ihre ID erhalten
  • NumberingParser.is_ordered_list() - prüfen, ob ein Liste-Level bestellt oder geschossen wird
  • NumberingParser.get_start_value() - Erhalten Sie die Startnummer für eine Liste-Level
  • NumberingParser.get_delimiter() — die Delimitärstring für eine Liste-Level erhalten

Stil Parzer

StyleParser Styling-Namen in strukturiert ParsedStyle Objekte, die Titel identifizieren, Blockquotes, Codeblöcke und Listeparagrafen:

  • StyleParser.parse() - ein Stilname in eine ParsedStyle Objekt
  • StyleParser.get_style_chain() - eine Kette von Stilnamen für erbe Stile zu verfeinern
  • StyleParser.is_setext_heading() - prüfen, ob ein Stil eine Setext-Stil-Heading ist
  • StyleParser.extract_all_styles() — die einzelnen Stilnamen aus einer comma-separierten Kette extrahieren

Datensatzmodell

Parsed-Nummerdaten werden in strukturierten Objekten gespeichert:

ClassSchlüssel Eigenschaften
NumberingInfonum_id, abstract_num_id, levels
NumberingLevelformat, start, text

Zusammenfassung

ParserPurpose
NumberingParserExtrakt Liste Nummerierung Definitionen
StyleParserParse-Stilnamen in strukturierte Informationen

Siehe auch

 Deutsch