-
Notifications
You must be signed in to change notification settings - Fork 1
fulltext_api
Stand: 5. Dezember 2025
Version: 1.0.0
Kategorie: Search
Status: ✅ Implementiert (v1) – BM25 Ranking mit HTTP Endpoint
Die Fulltext-Suche in Themis nutzt BM25 (Okapi BM25) für relevanzbasiertes Ranking. Der Index wird automatisch bei Entity-Operationen (PUT/DELETE) gepflegt.
POST /index/create
{
"table": "articles",
"column": "content",
"type": "fulltext",
"config": {
"stemming_enabled": true,
"language": "de", // en | de | none
"stopwords_enabled": true,
"stopwords": ["z.b."] // optional, zusätzliche Stopwords (lowercase)
,"normalize_umlauts": true // de: ä->a, ö->o, ü->u, ß->ss
}
}POST /search/fulltext
{
"table": "articles",
"column": "content",
"query": "machine learning optimization",
"limit": 100
}Response:
{
"count": 42,
"table": "articles",
"column": "content",
"query": "machine learning optimization",
"results": [
{"pk": "art_123", "score": 8.42},
{"pk": "art_456", "score": 7.91},
{"pk": "art_789", "score": 6.15}
]
}- k1 = 1.2: Term saturation (höhere Werte erhöhen Gewicht wiederholter Terms)
- b = 0.75: Document length normalization (0 = keine Normalisierung, 1 = volle Normalisierung)
-
IDF-Formel:
log((N - df + 0.5) / (df + 0.5) + 1.0)(stabilisiert)
N und avgdl werden aus dem Kandidaten-Universum (Vereinigung aller Token-Sets) berechnet (v1 Approximation).
-
Whitespace-basiert: Tokens werden bei Leerzeichen/Satzzeichen getrennt
-
Lowercase: Alle Tokens in Kleinbuchstaben konvertiert
-
Optionales Stemming (pro Index konfigurierbar):
- Aktivieren via
POST /index/createmittype: "fulltext"undconfig.stemming_enabled=true - Unterstützte Sprachen:
en(Porter-Subset),de(vereinfachtes Suffix-Stemming) - Query-Tokenisierung nutzt immer dieselbe Konfiguration wie der Index
- Aktivieren via
-
Optionales Stopword-Filtering (pro Index konfigurierbar):
- Aktivieren via
config.stopwords_enabled=true - Standard-Listen für
enundde; beilanguage: "none"wird nur die Custom-Liste angewendet - Eigene Stopwords via
config.stopwords: ["foo", "bar"] - Stopwords werden vor dem Stemming entfernt
- Aktivieren via
-
Optionale Normalisierung (DE):
- Aktivieren via
config.normalize_umlauts=true - Ersetzt
ä→a,ö→o,ü→u,ß→ssvor Tokenisierung/Stemming - Beispiel: "läuft" → "lauft" (erleichtert Suchanfragen ohne Sonderzeichen)
- Aktivieren via
- AND-Logik: Alle Query-Tokens müssen im Dokument vorkommen (Schnittmenge)
- Scoring: Dokumente mit höherer Termfrequenz und besserer Übereinstimmung erhalten höhere Scores
- Sortierung: Ergebnisse absteigend nach BM25-Score sortiert
- Quoted Phrases im Query werden als exakte Phrasen interpretiert, z. B.:
"deep learning" optimization
- Kandidatenbildung erfolgt weiterhin über Tokens außerhalb der Anführungszeichen (AND-Logik).
- Danach werden Kandidaten per Post-Filter behalten, wenn alle Phrasen im Originalfeldtext als Substring vorkommen.
- Case-insensitive Vergleich
- Optional mit
normalize_umlauts=true:ä→a,ö→o,ü→u,ß→ss
- Phrasen sind von Stemming/Stopwords nicht betroffen (Vergleich gegen den Feld-String, nicht gegen Tokens).
Einschränkungen (v1):
- Keine Positionslisten im Index – die Phrasenprüfung ist ein nachgelagerter Substring-Check und daher langsamer bei sehr großen Kandidatenmengen.
- Keine Wortgrenzen-/Satzzeichen-Logik; die Suche prüft eine einfache Teilzeichenkette nach Normalisierung/Lowercasing.
Der Fulltext-Index speichert:
-
Presence:
ftidx:table:column:token:PK→ "" (Inverted Index) -
Term Frequency:
fttf:table:column:token:PK→ TF-Count -
Doc Length:
ftdlen:table:column:PK→ Total Tokens in Doc
Die alte API scanFulltext() (C++ intern) liefert weiterhin nur PKs ohne Scores. Für Score-basierte Suche scanFulltextWithScores() verwenden.
- Kandidaten-basiert: BM25 wird nur für Kandidaten (Token-Schnittmenge) berechnet
- O(|tokens| × |candidates|): Skaliert mit Query-Komplexität und Kandidatenmenge
-
Limit-Parameter: Nutze
limitfür Top-k Retrieval (default: 1000)
- ✅ BM25 v1 mit HTTP API
- ✅ Hybrid Search: Text + Vector Fusion (RRF/Weighted)
- ✅ Analyzer: Stemming (EN/DE) pro Index konfigurierbar
- ✅ Umlaut-/ß-Normalisierung (DE) optional pro Index
- ✅ Phrase Search: "exact match" Queries (v1, ohne Positionsindex)
- ✅ AQL Integration v1.3:
FILTER FULLTEXT(...) AND <predicates>,SORT BM25(doc) DESC,RETURN {doc, score: BM25(doc)} - 🔲 Highlighting: Matched Terms in Response markieren
# 1. Index erstellen
POST /index/create {"table": "docs", "column": "text", "type": "fulltext"}
# 2. Dokumente einfügen
PUT /entities/docs/doc1 {"text": "Machine learning and deep neural networks"}
PUT /entities/docs/doc2 {"text": "Deep learning for computer vision"}
PUT /entities/docs/doc3 {"text": "Neural network optimization techniques"}
# 3. Suche mit Relevanz
POST /search/fulltext {
"table": "docs",
"column": "text",
"query": "deep learning neural",
"limit": 10
}
# Ergebnis: doc2 > doc1 > doc3 (nach BM25 Score sortiert)Status: ✅ Implementiert (03.11.2025)
Fulltext-Suche kann auch über die AQL-Query-Language verwendet werden:
FOR doc IN table
FILTER FULLTEXT(doc.column, "query" [, limit])
// optional weitere Prädikate per AND
// z. B. AND doc.year >= 2023
RETURN doc
Einfache Suche:
FOR article IN articles
FILTER FULLTEXT(article.content, "machine learning")
LIMIT 10
RETURN {title: article.title, abstract: article.abstract}
Phrasensuche:
FOR paper IN research_papers
FILTER FULLTEXT(paper.abstract, '"neural networks"')
LIMIT 20
RETURN paper
Mit benutzerdefiniertem Limit:
FOR doc IN documents
FILTER FULLTEXT(doc.body, "AI optimization", 50)
RETURN doc.title
Sortierung nach Relevanz (BM25 in AQL):
FOR doc IN articles
FILTER FULLTEXT(doc.content, "machine learning")
SORT BM25(doc) DESC
LIMIT 10
RETURN {title: doc.title, score: BM25(doc)}
HTTP API-Aufruf:
POST /query/aql
{
"query": "FOR doc IN articles FILTER FULLTEXT(doc.content, \"machine learning\") LIMIT 10 RETURN doc"
}-
Argumente:
-
field: Spaltenname (muss Fulltext-Index haben) -
query: Suchquery (Multi-Term mit AND-Logik, oder"phrase"für exakte Phrasen) -
limit: Optional, default 1000 (max. Kandidaten für BM25-Ranking)
-
-
Ranking: Automatisch nach BM25-Score sortiert (höchster zuerst)
-
Index-Requirement: Fulltext-Index muss via
POST /index/createerstellt sein -
Features: Nutzt Index-Konfiguration (Stemming, Stopwords, Normalisierung)
- FULLTEXT kann mit AND kombiniert werden. OR-Kombinationen werden über DNF-Übersetzung unterstützt (ein FULLTEXT pro Disjunkt).
- BM25-Scores sind in AQL über
BM25(doc)zugreifbar; sie werden bereitgestellt, wenn die Query den FULLTEXT-Ausführungspfad nutzt. Die End-to-End-Verdrahtung im AQL-Handler stellt dies sicher.
-
AQL-Syntax:
docs/aql_syntax.md- Vollständige AQL-Dokumentation - Index-Erstellung: Abschnitt "Index-Erstellung" oben
- Performance: Abschnitt "Roadmap" unten für geplante Optimierungen
- Architecture-ACCESS-MODEL-IMPLEMENTATION-SUMMARY
- Architecture-ADR-003-pg-dump-sql-parser
- Architecture-BASEENTITY-PRINCIPLE
- Architecture-CACHE-STORAGE-INTEGRATION
- Architecture-CMAKE-ARCHITECTURE
- Architecture-CMAKE-FLAGS-REFERENCE
- Architecture-CMAKE-MODULAR-ARCHITECTURE
- Architecture-CONCERNS-ARCHITECTURE-DIAGRAM
- Architecture-CONCERNS-IMPLEMENTATION-SUMMARY
- Architecture-CONTENT-MODEL
- Architecture-COPILOT-THEMISDB-GRAPH-RAG-BACKEND-ARCHITECTURE
- Architecture-CRYPTO-AND-KEYS
- Architecture-FEATURE-FLAGS-REFERENCE
- Architecture-GPU-ARCHITECTURE-REVIEW-TEMPLATE
- Architecture-HTTP-SHUTDOWN-HARDENING
- Architecture-MIGRATION-GUIDE-CONCERNS
- Architecture-MIGRATION-GUIDE-v13-v14
- Architecture-MODULARIZATION-GUIDE
- Architecture-MODULAR-ARCHITECTURE-ROADMAP
- Architecture-MODULE-ARCHITECTURE-INDEX
- Architecture-P1D01-ISSMPLUGIN-DESIGN-REVIEW
- Architecture-P1-D01-ISSMPLUGIN-DESIGN-REVIEW
- Architecture-P1-D08-MAMBA-GOVERNANCE-CONTRACT
- Architecture-P1-P2-IMPLEMENTATION-COMPLETION-INDEX
- Architecture-PHASE0-COMPLETION-ASSESSMENT
- Architecture-PHASE3-QUERYENGINE-DI-ARCHITECTURE
- Architecture-PHASE4-INDEX-MANAGER-DI
- Architecture-POSTGRESQL-WIRE-PROTOCOL
- Architecture-QUERYENGINE-IMPLEMENTATION-GUIDE
- Architecture-QUERY-SCHEDULING
- Architecture-RAFT-CONSENSUS-DESIGN
- Architecture-README
- Architecture-README-SSM-HYBRID-IMPLEMENTATION
- Architecture-REFACTORING-SUMMARY
- Architecture-RESOURCE-POOLING
- Architecture-SOURCE-DIRECTORY-GUIDE
- Architecture-THEMIS-CORE-GUIDE
- Architecture-UNIFIED-ACCESS-MODEL
- Architecture-WAL-GRPC-MTLS-CONFIGURATION
- Architecture-WIRE-PROTOCOL-RETRY
- Architecture-boltzmann-observability-draft
- Architecture-experimental-logarithmic-vector-storage
- Architecture-llm-wiki-mvp-adr
- Architecture-rewrite-engine-architecture
- Architecture-rope-api-architecture
- Architecture-ssm-gguf-mamba-status
- Architecture-ssm-hybrid-analysis
- Architecture-ssm-hybrid-rollout-plan
- Architecture-ssm-plugin-interface-design-review
- Architecture-transaction-coordinators
- Architecture-wiki-secondary-index
- Architecture-wire-protocol
- Governance-DISABLED-STUB-POLICY
- Governance-DOCS-PR-POLICY
- Governance-GA-PROMOTION-SIGN-OFF
- Governance-GITHUB-MILESTONES-SETUP
- Governance-MATURITY-CLAIM-VERIFICATION-CHECKLIST
- Governance-MATURITY-EVIDENCE-REGISTRY
- Governance-MERGE-GATE-BOT-CONFIG
- Governance-MERGE-GATE-STATUS-LIVE
- Governance-PHASE3-ENFORCEMENT-RUNBOOK
- Governance-PHASE-1-CLOSURE-REPORT
- Governance-PHASE-CLOSURE-POLICY
- Governance-PHASE-DEPENDENCY-GRAPH
- Governance-PLUGIN-SUBMODULE-ROLLBACK
- Governance-PRODUCTION-READY-2026-DELIVERY-PLAN
- Governance-PR-VERSION-TARGETING
- Governance-PR-VERSION-TARGETING-BACKFILL
- Governance-QUERY-MODULE-STATUS
- Governance-README
- Governance-RELEASE-PROMOTION-GATE-POLICY
- Governance-RELEASE-VALIDATION-CHECKLIST
- Governance-SECURITY-MODULE-5671-EVIDENCE-SUMMARY
- Governance-SHARDING-P6-RESIDUAL-RISK-ACCEPTANCE
- Governance-SOURCECODE-COMPLIANCE-GOVERNANCE
- Governance-UPDATES-DEVELOPMENT-STATUS-SIGN-OFF
- Governance-WAVE-C-IMPLEMENTATION-COMPLETE
- Module-acceleration-Roadmap
- Module-access-model-Roadmap
- Module-ai-Roadmap
- Module-analytics-Roadmap
- Module-api-Roadmap
- Module-aql-Roadmap
- Module-auth-Roadmap
- Module-base-Roadmap
- Module-cache-Roadmap
- Module-cdc-Roadmap
- Module-chaos-Roadmap
- Module-chimera-Roadmap
- Module-config-Roadmap
- Module-content-Roadmap
- Module-core-Roadmap
- Module-distributed-knowledge-Roadmap
- Module-distributed-tensor-Roadmap
- Module-document-Roadmap
- Module-ethics-ai-Roadmap
- Module-evaluation-Roadmap
- Module-execution-Roadmap
- Module-exporters-Roadmap
- Module-failover-Roadmap
- Module-geo-Roadmap
- Module-governance-Roadmap
- Module-gpu-Roadmap
- Module-graph-Roadmap
- Module-image-analysis-Roadmap
- Module-importers-Roadmap
- Module-index-Roadmap
- Module-ingestion-Roadmap
- Module-llama-cpp-Roadmap
- Module-llm-Roadmap
- Module-llm-streaming-Roadmap
- Module-llm-wiki-Roadmap
- Module-maintenance-Roadmap
- Module-metadata-Roadmap
- Module-network-Roadmap
- Module-observability-Roadmap
- Module-onnx-clip-Roadmap
- Module-performance-Roadmap
- Module-plugins-Roadmap
- Module-process-Roadmap
- Module-projects-Roadmap
- Module-prompt-engineering-Roadmap
- Module-query-Roadmap
- Module-rag-Roadmap
- Module-replication-Roadmap
- Module-retrieval-Roadmap
- Module-rpc-grpc-Roadmap
- Module-scheduler-Roadmap
- Module-scraper-Roadmap
- Module-search-Roadmap
- Module-security-Roadmap
- Module-server-Roadmap
- Module-sharding-Roadmap
- Module-stable-diffusion-Roadmap
- Module-storage-Roadmap
- Module-temporal-Roadmap
- Module-tensor-Roadmap
- Module-themis-Roadmap
- Module-timeseries-Roadmap
- Module-toolbox-Roadmap
- Module-training-Roadmap
- Module-transaction-Roadmap
- Module-updates-Roadmap
- Module-user-storage-encrypted-Roadmap
- Module-utils-Roadmap
- Module-vector-search-Roadmap
- Module-voice-Roadmap
- Module-whisper-Roadmap