System · die Aufnahme, sie liest

Pharynx

Schluckt Dokumente, liefert sauberen Text.

Pharynx nimmt die Dokumente auf, die das Unternehmen schon hat, und normalisiert sie zu sauberem Text, den das Gehirn zu Wissen verdichten kann.

In aktiver Entwicklung

Der Ablauf

PDF · DOCX · XLSX · HTML
Pharynx
Saubere Textabschnitte
Cortex
  • PDF · DOCX · XLSX · HTML heute; OCR und Audio als Nächstes.
  • Teilt an Absatzgrenzen auf, behält die Quelle.
  • Übergibt direkt an den Ingest von Cortex.

Im Zusammenspiel

Der Eingang für vorhandene Dokumente; übergibt sauberen Text an Cortex.

Unter der Haube

Vom Dokument zu sauberem, aufgeteiltem Text.

Ein kleiner FastAPI-Dienst mit einer erweiterbaren Registry für Extraktoren: Format erkennen, sauberen Text herausziehen, aufteilen und jedes Stück an Cortex übergeben.

Die Aufnahme-Pipeline

Dokument
Format erkennen
Magic Bytes
Extrahieren
je Format
Aufteilen
~12k · an Absätzen
Cortex /cards/ingest
ein Job pro Abschnitt

POST /v1/ingest extrahiert, teilt auf und übergibt an Cortex; /v1/extract gibt nur den Text zurück. Jeder Abschnitt wird zu einem eigenen Ingest-Job in Cortex.

Liest heute

PDFpypdfDOCXpython-docxHTMLbeautifulsoupXLSXopenpyxlCSVstdlibMarkdownText

Vorgesehen · Welle 2

Bilder · OCRAudio · über LarynxVideo
Heute sieben Formate. Ein gescanntes oder verschlüsseltes PDF wird ehrlich abgelehnt, statt als Zeichensalat zurückzukommen. OCR ist für Welle 2 vorgesehen.
Das Format wird an den Magic Bytes der Datei erkannt, nicht am Dateinamen; ein unbekannter Typ wird abgelehnt, nicht erraten.
Text wird an Absatzgrenzen aufgeteilt; ein Cortex-Job pro Abschnitt, und jeder behält die ID seiner Quelle, damit die Herkunft nachvollziehbar bleibt.
Dienst-Authentifizierung innerhalb desselben Mandanten: ein kurzlebiges HS256-JWT aus einem gemeinsamen Secret, ohne Umweg über einen Login.

Die übrigen Systeme

Dies ist ein Teil eines Systems, das für ein einziges Versprechen gebaut ist: Jede Antwort ist belegt und rechtebewusst, oder sie kommt gar nicht.