System · die Aufnahme, sie liest
Pharynx
Schluckt Dokumente, liefert sauberen Text.
Pharynx nimmt die Dokumente auf, die das Unternehmen schon hat, und normalisiert sie zu sauberem Text, den das Gehirn zu Wissen verdichten kann.
In aktiver EntwicklungDer Ablauf
- PDF · DOCX · XLSX · HTML heute; OCR und Audio als Nächstes.
- Teilt an Absatzgrenzen auf, behält die Quelle.
- Übergibt direkt an den Ingest von Cortex.
Im Zusammenspiel
Der Eingang für vorhandene Dokumente; übergibt sauberen Text an Cortex.
Unter der Haube
Vom Dokument zu sauberem, aufgeteiltem Text.
Ein kleiner FastAPI-Dienst mit einer erweiterbaren Registry für Extraktoren: Format erkennen, sauberen Text herausziehen, aufteilen und jedes Stück an Cortex übergeben.
Die Aufnahme-Pipeline
POST /v1/ingest extrahiert, teilt auf und übergibt an Cortex; /v1/extract gibt nur den Text zurück. Jeder Abschnitt wird zu einem eigenen Ingest-Job in Cortex.
Liest heute
Vorgesehen · Welle 2
Die übrigen Systeme
Dies ist ein Teil eines Systems, das für ein einziges Versprechen gebaut ist: Jede Antwort ist belegt und rechtebewusst, oder sie kommt gar nicht.