VAARHAFT
Technologie

Document
Trust Layer

Der Document Trust Layer ist VAARHAFTs proprietäre Deep-Learning-Architektur, die gefälschte, manipulierte und KI-generierte Dokumente erkennt. Trainiert auf echten Real-World-Betrugsdaten, nicht auf akademischen Laborbenchmarks.

>95%Detection Accuracy
80%Precision @ 1% Prevalence
<5sAvg Latency
Detection Analysis
Manipulation Detected
REGION 97.2% CONFIDENCE0.97
modules: gen_detect · tamper_detect · heatmap2.4s · 12 tokens
Dokument-Erkennungsmodule

Vollständige Dokumentenanalyse. Sechs Module. Ein API Call.

Jedes Modul übernimmt eine spezifische Dokumentenanalyse-Aufgabe. Proprietäre Neural Networks für Fälschungserkennung, deterministische Algorithmen für Strukturvalidierung und tiefgehende Metadaten-Extraktion. Alles über einen einzigen Endpoint.

Modul 01Proprietary Model

AI-Generated Document Detection

Erkennt vollständig KI-generierte Dokumente von GPT-4o, Gemini oder anderen generativen Modellen. Identifiziert synthetische Layouts, Schriften und Inhaltsmuster.

Modul 02Proprietary Model

Document Tampering Detection

Erkennt nachträgliche Dokumentenfälschung: geänderte Beträge, ausgetauschte Felder, modifizierte Unterschriften, Copy-Paste-Artefakte und Font-Rendering-Inkonsistenzen.

Modul 03Deterministic

Duplicate Check

Interne und externe Duplikaterkennung über Dokumenten-Repositories hinweg. Identifiziert wiedereingereichte, recycelte oder geklonte Dokumente über einfachen Hash-Vergleich hinaus.

Modul 04Provenance

Metadata Analysis

Extrahiert und referenziert PDF-Metadaten, Erstellungstools, Font-Embedding, Kompressionsartefakte und Bearbeitungshistorie zur Verifizierung der Dokumentenauthentizität.

Modul 05Deterministic

PDF Structural Analysis

Untersucht die interne Struktur von PDF-Dateien: Objektbäume, Stream-Encoding, Font-Subsetting und Layer-Komposition zur Erkennung struktureller Anomalien.

Modul 06Classification

Document Classification

Klassifiziert automatisch Dokumenttypen (Rechnungen, Verträge, Ausweisdokumente, Zertifikate), um jedes Dokument in die passende Verifizierungs-Pipeline zu leiten.

Deep Technology

Proprietäre Document Forensic Networks

Keine Off-the-Shelf Foundation Models. Unsere gesamte Dokumentenanalyse-Pipeline ist von Grund auf mit spezialisierten Architekturen für strukturelle, visuelle und semantische Dokumentenanalyse gebaut, trainiert ausschließlich auf proprietären forensischen Datensätzen.

  • Multi-Layer Document Analysis

    Analysiert Dokumente gleichzeitig auf drei Ebenen: visuelles Erscheinungsbild, strukturelles Layout und semantische Inhaltskonsistenz.

  • Intrinsic Explainability

    Die Erklärbarkeit ist fester mathematischer Bestandteil der Backpropagation, nicht nachträglich erzeugt wie bei GradCAM oder ELA. Der Beweis ist Teil der Klassifikation.

  • Deterministisch, kein LLM

    100% reproduzierbare Ergebnisse. Kein stochastisches LLM, kein Prompt-Engineering, keine Halluzinationen.

  • Adversarial Hardening

    Gehärtet gegen Adversarial Perturbations und reales Document Laundering: Scans, Faxe, Re-Exporte und Mehrfach-PDF-Kompression.

Document Processing PipelineLIVE
InputImage / DocumentFORENSIC ANALYSISMulti-Module EngineProprietary DetectionMANIPULATED97.2%{ "score": 0.972"verdict": ...}VerdictJSON ResponseUPLOAD → FORENSIC ANALYSIS → VERDICT + STRUCTURED JSON

Eine hochoptimierte, mehrstufige Feature-Extraction-Pipeline, trainiert auf dokumentenspezifische Fälschungsartefakte, selbst nach Scannen, Faxen oder Re-Export. Intrinsische Erklärbarkeit als mathematisches Nebenprodukt, kein Post-hoc XAI.

Real-World-Performance

Gebaut für die Realität, nicht fürs Labor.

Akademische Benchmarks testen auf unberührten, hochauflösenden PDFs. Betrüger nutzen gescannte Kopien, gefaxte Reproduktionen und re-exportierte Dateien. Die Benchmarks der meisten Dokumentenforensik-Anbieter sind für die Tonne.

Unser Modell wurde nicht im Labor, sondern auf echten Dokumentenbetrugs-Daten trainiert. Wir evaluieren unsere Metriken explizit auf degradierten Dokumenten: Scans, Faxe und re-komprimierte PDFs.

>95%ErkennungsgenauigkeitReal-World Data
8 von 10Alarme sind korrektNeedle-in-a-Haystack
AI Generation Detection97.1%
Tampering Detection93.8%
False Positive Rate0.2%

80% Precision @ 1% Prevalence: Selbst wenn 99 von 100 Dokumenten authentisch sind, liegt unser Modell in 8 von 10 Fällen richtig, wenn es ein Dokument als gefälscht flaggt.

Unsere Performance gilt auch wenn ein gefälschtes Dokument:

  • Mehrfach über Büro- und Consumer-Scanner gescannt wurde
  • Gefaxt, re-exportiert oder gedruckt und re-digitalisiert wurde
  • Komprimiert oder in der Auflösung herunterskaliert wurde
  • Durch OCR-Pipelines geschleust wurde, die Metadaten entfernen
  • Über Print-Scan-Fax-Zyklen degradiert wurde

FP-Catcher Module

Die reine Dokumentenanalyse reicht für die Produktion nicht aus. Spezialisierte False-Positive Catcher Module sind an reale Produktionsbedingungen angepasst. Beispiel: Wasserzeichen und Stempel werden automatisch erkannt und gefiltert, um Fehlauslöser bei legitimen Overlays zu vermeiden.

Konfigurierbare Erkennung

Precision vs. Recall. Ihre Entscheidung.

Unterschiedliche Use Cases erfordern unterschiedliche Trade-offs. Automatisierte Ablehnung braucht maximale Precision. Screening mit Human-in-the-Loop maximiert Recall.

Wählen Sie den Modus, der zu Ihrem Risk-Appetite passt, oder lassen Sie uns Ihr Modell individuell kalibrieren.

0%0%25%25%50%50%75%75%100%100%RecallPrecisionP: 82% · R: 80%

Balanced: Ausgewogenes Verhältnis zwischen Precision und Recall. Standard-Konfiguration für die meisten Enterprise-Kunden.

Beyond Base Metrics

Maßgeschneiderte Kalibrierung

Unsere Out-of-the-Box Metriken sind branchenführend, aber jedes Unternehmen hat eigene Dokumentenverteilungen. Wir bieten eine tiefe System-Kalibrierung an, um das Modell exakt auf die Anforderungen unserer Enterprise-Kunden einzustellen.

Durch fortgeschrittene Probability Calibration und Modellfinetuning stellen wir sicher, dass ein Confidence-Score von 90% auch wirklich einer 90%igen Wahrscheinlichkeit für eine Fälschung entspricht. Optimal für die nahtlose Integration in bestehende Risk-Engines.

Probability CalibrationIsotonic Regression auf Ihren Daten
Threshold TuningOptimaler Cut-off für Ihr Risk-Profile
Model FinetuningDomain-spezifisches Transfer Learning
Score MappingDirekte Integration in Risk-Engines
Enterprise Calibration
RawCalibrated
0%0%25%25%50%50%75%75%100%100%idealPredicted ProbabilityActual ProbabilityPrecision82%Recall75%Confidence90%Base89.0%Calibrated93.2%Fine-tuned97.1%
Training Data
GeneratedManipulatedAuthentic
10M+ IMAGES
Data Advantage

Proprietäre Real-World Data

Unser Modell wurde nicht im akademischen Labor trainiert. Über 5 Millionen in-house kuratierte Dokumentenproben, händisch manipuliert von Forensik-Experten, simulieren extreme Real-World-Bedingungen inklusive Scan-Degradation und gezielter Feldmanipulation.

Die meisten Open-Source-Tools für Dokumentenforensik setzen auf Template-Matching oder einfache Metadaten-Checks. Sie scheitern an gescannten Kopien, gefaxten Reproduktionen und re-exportierten PDFs, weil die visuellen Artefakte, auf die sie angewiesen sind, dabei zerstört werden. Unsere proprietären Modelle werden gezielt auf diese degradierten Eingaben trainiert. Deshalb bleibt unsere Genauigkeit stabil unter Bedingungen, bei denen konventionelle Ansätze unbrauchbar werden.

>5MKuratierte Dokumentenproben
40+Fälschungstechniken
80+Dokumententypen
WöchentlichRetraining-Kadenz

Zero-Day GenAI Defense

Wenn neue KI-Dokumentengeneratoren veröffentlicht werden, integrieren wir deren Signaturen innerhalb von Tagen, nicht Wochen.

Infrastruktur

Enterprise-Grade von Grund auf.

Auto-Scaling GPU

Elastic Concurrency

GPU-Cluster (NVIDIA Tensor Core) skalieren dynamisch. 10 Requests nachts oder 5.000 RPM bei einer Kampagne. Die Latenz bleibt stabil.

Multi-Model Voting

Ensemble Classification

Spezialisierte Sub-Models voten unabhängig auf Generation- und Manipulation-Probability, kombiniert via kalibriertes Ensemble.

TensorRT INT8

0ms Cold-Start

Dedicated Endpoints, kein Serverless Cold-Start Penalty. Inference optimized via TensorRT (INT8 Quantization).

End-to-End

< 5s Avg Latency

Durchschnittliche End-to-End-Latenz inklusive Ensemble-Voting, Heatmap-Generierung und JSON-Response.

Zero-Retention

Stateless Processing

Zero-Retention API: Wir speichern keine Dokumente. Der RAM wird direkt nach der Inference geleert. Privacy by Design.

Alle Formate

Native Format Support

Unterstützt alle gängigen Dokumentenformate nativ: PDF, TIFF, JPEG, PNG, WebP. Mehrseitige PDFs werden Seite für Seite verarbeitet.

Upload

Smart Payload Management

Direkter Upload bis 10 MB für Einzeldokumente. Für große Payloads und Batch-Pipelines asynchrones S3-Offloading bis 80 MB mit Webhook-Benachrichtigung bei Abschluss.

Warum VAARHAFT

Technology Leadership Through Specialization

01

Proprietary Real-World Data

Über 5 Millionen in-house kuratierte Dokumentenproben, die extreme Real-World-Bedingungen simulieren, inklusive Scan-Degradation und gezielter Feldmanipulation. Robustheit dort, wo herkömmliche SOTA-Modelle einbrechen.

02

Zero-Day GenAI Defense

Wenn neue KI-Dokumentengeneratoren veröffentlicht werden, integrieren wir deren Signaturen innerhalb von Tagen. Radikale Agilität im Katz-und-Maus-Spiel der KI-generierten Fälschungen.

03

Stateless & EU-AI-Act Ready

Entwickelt und gehostet in Deutschland. Zero-Retention API: Der RAM wird direkt nach der Inference geleert, keine Kundendaten gespeichert. Vollständig audit-fähig, EU AI Act konform, kein Drittanbieter-Datenabfluss.

04

Intrinsic Explainability (No Black Box)

Unsere Architektur generiert Erklärbarkeit nicht im Nachhinein, sondern als zwingendes mathematisches Nebenprodukt. Granulare JSON-Daten und spatial Heatmaps beweisen pixelgenau, warum ein Dokument geflaggt wurde.

05

Enterprise-Grade-Infrastruktur

Von Grund auf für Skalierung gebaut. Asynchrone Webhooks, deterministische Verarbeitung ohne LLM-Overhead und nahtloses S3-Payload-Offloading für Gigabyte-schwere Dokumenten-Pipelines.

06

Production-Ready FP-Catcher

Spezialisierte Module für reale Produktionsbedingungen. Wasserzeichen-Erkennung, Stempel-Filterung und adaptive Threshold-Anpassung reduzieren False Positives auf ein Minimum.

In Production

Die Technologie hinter dem Fraud Scanner

Der Document Trust Layer ist die Core Document Detection Engine des VAARHAFT Fraud Scanners, verfügbar als fully managed API. Keine Infrastruktur, kein Model Maintenance. Einmal integrieren, dauerhaft profitieren.

  • Single REST API call, Ergebnis in unter 5 Sekunden
  • Fraud Probability Score (0–1) + spatial Heatmap
  • Batch Processing für High-Volume Enterprise Workflows
  • Automatisierte PDF Audit Reports für Compliance
  • User Interface verfügbar, kein Coding erforderlich
POST /v2/fraudscanner
200 OK · 3.1s

{

"suspicion_level": "Red",

"Files": {

"invoice.pdf": { … },

"contract.pdf": { … }

},

"caseNumber": "Case 456B",

"sessionId": "7c2e9af1-5512-48b3-a1d7-ee43bc8d91f0",

"modelVersions": {

"imagesModelVersion": "vh-mo-images-alpha",

"documentsModelVersion": "vh-mo-docs-alpha"

},

"tokensConsumed": 18,

"attachments": {

"heatmaps": [ … ],

"analysis_report": [ … ]

}

}

Frequently asked questions

Wir erkennen KI-generierte Dokumente von Systemen wie GPT-4o und Gemini, nachträgliche Manipulationen wie geänderte Beträge oder ausgetauschte Felder, Duplikat-Einreichungen über Repositories hinweg und strukturelle Anomalien in PDF-Dateien. Unsere sechs Module decken das volle Spektrum von synthetischer Dokumentengenerierung bis gezielter Feld-Manipulation ab.

Anders als Tools, die auf saubere digitale PDFs angewiesen sind, werden unsere Modelle explizit auf degradierten Eingaben trainiert: gescannte Kopien, Smartphone-Fotos, gefaxte Reproduktionen und re-komprimierte Dateien. Die Erkennungsgenauigkeit bleibt stabil, weil unsere Trainingsdaten reale Bedingungen abbilden, nicht Labor-Originale.

Ja. Unser Tampering-Detection-Modul identifiziert nachträgliche Manipulationen auf Feldebene: geänderte Beträge, modifizierte Unterschriften, ausgetauschte Felder, Copy-Paste-Artefakte und Font-Rendering-Inkonsistenzen. Die Heatmap-Ausgabe zeigt exakt, welche Dokumentbereiche die Erkennung ausgelöst haben.

Wir setzen spezialisierte FP-Catcher-Module für Produktionsbedingungen ein. Stempel, Firmenlogos und vorhandene Wasserzeichen werden automatisch erkannt und von der forensischen Analyse ausgeschlossen. Enterprise-Kunden können zusätzlich individuelle Schwellenwerte für ihre spezifischen Dokumententypen konfigurieren.

Die API unterstützt PDF (ein- und mehrseitig), TIFF, JPEG, PNG und WebP nativ. Mehrseitige PDFs werden Seite für Seite verarbeitet. Für große Batch-Pipelines verarbeitet asynchrones S3-Offloading Dateien bis 80 MB mit Webhook-Benachrichtigung bei Abschluss.

Nein. Der Document Trust Layer nutzt eine Zero-Retention-Architektur. Dokumente werden im GPU-RAM verarbeitet und sofort nach der Inferenz gelöscht. Keine Kundendokumente werden gespeichert, protokolliert oder aufbewahrt. Die API ist vollständig stateless, in Deutschland gehostet und EU AI Act konform.

VAARHAFT Trust Suite

Ein Technologie-Stack. Fünf Trust Layer.

Zur Technologie-Übersicht

Jedes VAARHAFT-Produkt baut auf derselben proprietären Technologiebasis auf: fünf spezialisierte Trust Layer für Bilder, Dokumente, Audio, kontextuelle Informationen und Capture-Time-Quellenverifikation. Gemeinsam bilden sie die technologische Basis der VAARHAFT Trust Suite.

In Produktion bilden diese Layer die Basis der VAARHAFT Trust Suite Produkte:Fraud ScannerSafeCamSafeMic
Loslegen

Testen Sie mit Ihren eigenen Dokumenten

Buchen Sie eine Demo und sehen Sie, wie unsere Erkennung auf Ihrer realen Dokumenten-Pipeline performt. Wir zeigen Ihnen Integration, Schwellenwert-Konfiguration und Deployment-Optionen.