-
Notifications
You must be signed in to change notification settings - Fork 1
Architecture experimental logarithmic vector storage
Navigation: Home > Architecture
Architekturvorschlag: Experimentelle logarithmische ZahlenreprΓ€sentation fΓΌr Vektor- und KI-nahe Workloads in ThemisDB
Experimental / Research Proposal
ThemisDB soll experimentell untersuchen, ob eine logarithmische ZahlenreprΓ€sentation fΓΌr vektor- und KI-nahe Workloads Vorteile bringt.
Die zentrale Hypothese ist:
- Viele KI- und Vektor-Workloads bestehen ΓΌberwiegend aus Multiplikationen, Dot-Products, Matrixoperationen und Similarity-Berechnungen.
- Logarithmische ReprΓ€sentationen kΓΆnnen solche Workloads unter bestimmten Bedingungen effizienter machen.
- Der mΓΆgliche Nutzen liegt primΓ€r in:
- geringerem Speicherbedarf,
- besserer Cache-LokalitΓ€t,
- reduzierter Bandbreite,
- potenziell effizienterer AusfΓΌhrung spezialisierter numerischer Operatoren.
Diese Architektur ist kein Vorschlag fΓΌr den allgemeinen numerischen Kern von ThemisDB. Sie ist ausdrΓΌcklich auf Vektor-, Embedding-, Retrieval- und KI-nahe Verarbeitungspfade begrenzt.
ThemisDB ist als hybrides Datenbanksystem mit Vektor-, Graph-, Relational- und Dateimodell positioniert. Dadurch existiert ein sinnvoller Einsatzbereich fΓΌr alternative numerische ReprΓ€sentationen, insbesondere dort, wo:
- groΓe Mengen an Embeddings gespeichert werden,
- Similarity Search ausgefΓΌhrt wird,
- Dot-Product- oder Cosine-Similarity-Berechnungen dominieren,
- Re-Ranking oder kleine inferenznahe Operatoren integriert werden,
- Speicherbandbreite und Cache-Effizienz begrenzende Faktoren sind.
Im klassischen relationalen Kern gelten dagegen andere PrioritΓ€ten:
- exakte Semantik,
- stabile Vergleichbarkeit,
- deterministische Aggregation,
- InteroperabilitΓ€t,
- mΓΆglichst geringe KomplexitΓ€t im Storage- und Transaktionssystem.
Deshalb wird die logarithmische Darstellung nicht als universelles Speicherformat vorgeschlagen.
Die Untersuchung soll sich auf folgende Bereiche konzentrieren:
-
Embedding-Storage
- Speicherung dichter Vektoren in optional log-kodierter Form
- Vergleich mit Float32, Float16, BFloat16, Int8 und weiteren kompakten Formaten
-
Similarity Search
- Dot Product
- Cosine Similarity
- eventuell weitere ANN-nahe Distanz- oder Scoring-Funktionen
-
Vektorindizes und abgeleitete Speicherformate
- materialisierte, workload-spezifische ReprΓ€sentationen
- optional separate physische Formate neben dem kanonischen Datentyp
-
KI-nahe AusfΓΌhrungspfade
- Retrieval
- Re-Ranking
- vorbereitende numerische Operatoren fΓΌr Inference-/RAG-Γ€hnliche AblΓ€ufe
Folgende Bereiche sollen zunΓ€chst nicht betroffen sein:
- MVCC
- WAL / Recovery
- relationale Kernoperatoren
- generische numerische Datentypen
- exakte DECIMAL-/NUMERIC-Semantik
- B-Tree-/Hash-SchlΓΌsselreprΓ€sentationen
- allgemeine Aggregationen wie SUM/AVG/COUNT
- Sortierung, Range-Filters und Standard-Vergleichssemantik
ThemisDB behΓ€lt fΓΌr Vektordaten zunΓ€chst ein etabliertes kanonisches Format bei, z. B.:
- Float32
- Float16
- BFloat16
Dieses Format bleibt die Referenz fΓΌr:
- Persistenzsemantik,
- InteroperabilitΓ€t,
- Debugging,
- deterministische Validierung,
- exaktes Re-Ranking oder Fallback-Pfade.
ZusΓ€tzlich kann ThemisDB ein abgeleitetes physisches Format bereitstellen, z. B.:
LOG8LOG12LOG16
Diese Formate sind keine neuen universellen SQL-/AQL-Standardtypen, sondern interne oder explizit deklarierbare Optimierungsformate fΓΌr spezialisierte Vektor-Workloads.
Ein Vektor kann kΓΌnftig in zwei Formen existieren:
- Canonical Representation
- Optimized Log Representation
Die optimierte ReprΓ€sentation darf:
- beim Ingest erzeugt werden,
- lazy erzeugt werden,
- materialisiert oder rebuildbar sein,
- fΓΌr spezialisierte AusfΓΌhrungspfade selektiv verwendet werden.
Dieses Modell reduziert das Risiko, die allgemeinen Systemeigenschaften von ThemisDB zu verschlechtern.
Benutzer arbeiten weiterhin mit normalen Vektorwerten und Standard-APIs.
Beispielhaft:
- Vektorspalten werden regulΓ€r definiert.
- Eine zusΓ€tzliche Storage- oder Index-Option aktiviert experimentelle log-kodierte Nebenstrukturen.
Unterhalb der logischen Ebene kann ThemisDB optional erzeugen:
- log-kodierte Embedding-BlΓΆcke,
- log-kodierte ANN-/Similarity-optimierte Segmente,
- Operatorpfade, die auf diesen Formaten direkt arbeiten.
Der Query Planner oder Execution Layer kann spΓ€ter entscheiden:
- normaler Pfad mit kanonischen Werten,
- optimierter Pfad mit log-kodierter ReprΓ€sentation,
- hybrider Pfad mit Approximation fΓΌr Candidate Generation und exaktem Re-Ranking im kanonischen Format.
Verantwortlich fΓΌr:
- Umwandlung von Vektorkomponenten in eine log-kodierte Darstellung,
- Verwaltung von Vorzeichen, Exponent-/Basiswahl und SpezialfΓ€llen,
- Behandlung von Nullwerten und sehr kleinen BetrΓ€gen,
- optionale Rekonstruktion in linearen Raum.
Offene Designfragen:
- Welche Basis wird verwendet?
- Wie werden Vorzeichen kodiert?
- Wie werden Null, Near-Zero, Underflow und Overflow behandelt?
- Welche PrΓ€zisionsstufen sind sinnvoll?
Verantwortlich fΓΌr:
- Speichern log-kodierter Embeddings,
- Blocklayout fΓΌr Cache-LokalitΓ€t,
- KompatibilitΓ€t mit Segmenten, Pages oder Columnar-Strukturen,
- optional getrennte Persistenz oder materialisierte Nebenstruktur.
Verantwortlich fΓΌr spezialisierte Operatoren wie:
- dot product,
- cosine similarity,
- candidate scoring,
- ANN-nahe Vergleichsoperatoren.
Diese Operatoren sollen experimentell prΓΌfen, ob ein Teil der numerischen Arbeit direkt auf der log-kodierten ReprΓ€sentation effizienter ausfΓΌhrbar ist.
Verantwortlich fΓΌr:
- Auswahl des geeigneten AusfΓΌhrungspfads,
- Fallback auf kanonische ReprΓ€sentation,
- Mischbetrieb zwischen Approximation und exakter Endbewertung,
- Kostenmodell fΓΌr Speicher, CPU, Latenz und Genauigkeit.
Verantwortlich fΓΌr:
- reproduzierbare Benchmarks,
- Recall-/Accuracy-Messung,
- Speicherverbrauch,
- Latenzmessung,
- Vergleich mit anderen ReprΓ€sentationen.
Die Untersuchung basiert auf folgenden erwarteten Potenzialen:
-
Geringerer Speicherbedarf
- kompaktere ReprΓ€sentation von Embeddings
- mehr Vektoren im RAM / Cache
-
Bessere Cache-LokalitΓ€t
- geringere Transferkosten zwischen Speicherhierarchien
-
Reduzierte Bandbreite
- insbesondere relevant bei groΓen Similarity-Scans
-
Spezialisierte numerische Beschleunigung
- potenzielle Vereinfachung bestimmter multiply-dominierter Operatoren
-
Bessere Skalierung fΓΌr Vektor-Features
- vor allem bei Retrieval-, RAG- und Embedding-zentrierten Anwendungen
Die Untersuchung muss ausdrΓΌcklich folgende Risiken validieren:
-
Genauigkeitsverlust
- Recall-Verlust bei Similarity Search
- Verzerrung von Scores
- instabile Rangfolgen bei knappen AbstΓ€nden
-
Konvertierungskosten
- Transformation in den Log-Raum kann Nutzen teilweise aufheben
-
KomplexitΓ€t der Addition / Akkumulation
- nicht alle numerischen Operationen profitieren gleichermaΓen
-
ImplementierungskomplexitΓ€t
- CPU-/SIMD-/GPU-Pfade werden komplizierter
- Debugging und Validierung werden schwieriger
-
Unklarer Mehrwert gegenΓΌber etablierter Quantisierung
- Float16, BFloat16, Int8, Binary oder PQ kΓΆnnen in der Praxis bereits ausreichend gut sein
-
Technische Fragmentierung
- zu viele Spezialpfade kΓΆnnen Wartbarkeit und PortabilitΓ€t verschlechtern
Die experimentelle Untersuchung soll mindestens folgende Fragen beantworten:
- Ist log-kodierter Embedding-Storage in ThemisDB speichereffizienter als Float16 oder Int8?
- Welche Auswirkungen hat die ReprΓ€sentation auf Recall@K und Ranking-QualitΓ€t?
- FΓΌr welche Operatoren entsteht tatsΓ€chlich ein Laufzeitvorteil?
- Wie hoch sind die Konvertierungs- und Materialisierungskosten?
- Welche Basis und PrΓ€zision liefern den besten Kompromiss aus Genauigkeit und Effizienz?
- Lohnt sich der Ansatz nur fΓΌr Candidate Generation oder auch fΓΌr spΓ€tere Scoring-Phasen?
- Ist ein hybrider Ansatz besser als eine vollstΓ€ndig log-kodierte AusfΓΌhrung?
Die Entscheidung ΓΌber eine Weiterentwicklung darf nur benchmarkbasiert erfolgen.
Mindestens zu vergleichen sind:
- Float32
- Float16
- BFloat16
- Int8
- gegebenenfalls Binary / weitere Quantisierungsverfahren
- experimentelle log-kodierte Formate
Zu messen sind mindestens:
- Recall@K
- nDCG / Ranking-QualitΓ€t
- Speicherverbrauch pro Vektor und pro Datensatz
- Ingest-Kosten
- Materialisierungskosten
- Query-Latenz (p50 / p95 / p99)
- Durchsatz
- IndexgrΓΆΓe
- Rebuild-/Compaction-Kosten
- optional Energieverbrauch
Empfohlen sind:
- synthetische DatensΓ€tze mit kontrollierter Verteilung
- reale Embedding-DatensΓ€tze
- unterschiedliche DimensionalitΓ€ten
- kleine, mittlere und groΓe Korpora
- isolierter Encoder/Decoder
- experimentelles Speicherformat
- Benchmark-Harness
- Vergleich gegen Float16 / Int8
- Dot-Product- und Cosine-Similarity-Prototypen
- Candidate Generation auf log-kodierten Vektoren
- exaktes Re-Ranking im kanonischen Format
- experimentelle Storage-Option
- plannergesteuerter Pfad
- Feature Flag / Build Flag
Nur wenn die Benchmarks klar zeigen, dass mindestens einer der folgenden Punkte signifikant besser ist:
- Speicherbedarf,
- Latenz,
- Durchsatz,
- TCO,
- oder Skalierbarkeit
bei akzeptabler Genauigkeit und beherrschbarer KomplexitΓ€t.
Entscheidung:
ThemisDB untersucht logarithmische ZahlenreprΓ€sentationen experimentell und optional fΓΌr Vektor- und KI-nahe Workloads.
Nicht-Ziel:
Die allgemeine relationale oder transaktionale Kernarchitektur von ThemisDB wird dadurch nicht ersetzt oder umgestellt.
Bevorzugter Ansatz:
- kanonisches Format beibehalten,
- log-kodierte ReprΓ€sentationen als abgeleitete physische Optimierung einsetzen,
- Approximation zunΓ€chst auf Similarity Search / Retrieval konzentrieren,
- Ergebnisse benchmarkbasiert bewerten.
Aus heutiger Sicht ist die logarithmische ReprΓ€sentation fΓΌr ThemisDB am vielversprechendsten in:
- Embedding-Storage,
- Vektorindizes,
- Similarity Search,
- Retrieval-/RAG-nahe Pfade,
- numerisch kompakten KI-Hilfsoperatoren.
Sie sollte nicht als allgemeines Standardformat fΓΌr sΓ€mtliche numerischen Daten eingefΓΌhrt werden, solange kein klarer wissenschaftlicher und benchmarkbasierter Nachweis fΓΌr einen breiten Nutzen vorliegt.
ThemisDB 1.9.0-beta Β· Home Β· Module-Index Β· GitHub Β· Issues
ThemisDB 1.9.0-beta Β· Home Β· Wiki-Index Β· Module-Index Β· FAQ Β· Quick-Reference Β· GitHub Β· Issues Β· Discussions Β· License
- Batch Operations
- Best Practices
- CRUD Tutorial
- Custom Document Ingestion
- Getting Started Tutorial
- Interactive Examples
- Schema Design
- Video Tutorials
- AQL Reference
- AQL Examples
- AQL Overview
- AQL Feature Roadmap
- AQL Geospatial Guide
- AQL LLM Migration Guide
- AQL API
- AQL Grammar (EBNF)
- AQL Root Overview
- AQL Examples (root)
- API Reference
- API Module README
- OpenAPI Overview
- Client SDK Overview
- SDK Overview
- Operations
- Operations Overview
- Operations Runbook
- Operations Handbook
- ThemisCtl Admin Guide
- Pipeline E2E SOPs
- Deploy Overview
- Docker Overview
- Docker Hub README
- Helm Overview
- Packaging Overview
- Operator Overview
- Security Policy
- Production Hardening Checklist
- Security Hardening Guide
- Encryption Key Management
- Access Control Framework
- Zero Trust Policy
- API Authentication & Authorization
- HSM Production Setup
- PKCS11 Integration
- DSGVO / SOC2 Checklist
- Access Model Runbooks
- Access Model Dashboard
- Maturity Automation Runbook
- Access Review Automation
- Access Model Dashboard
- Access Model Runbooks
- Rights Revocation
- Dr Checklists
- Dr Testing
- Incident Response Playbook
- Incident Response Testing
- GPU Oom Recovery
- Grammar Debugging
- Metrics Scrape Troubleshooting
- Model Swap Procedure
- Quota Tuning
- Subagent Deployment
- Logging Configuration
- Content Model
- Crypto & Keys
- Feature Flags Reference
- Modular Architecture Roadmap
- Modularization Guide
- Module Architecture Index
- PostgreSQL Wire Protocol
- Query Scheduling
- Raft Consensus Design
- Resource Pooling
- Source Directory Guide
- Unified Access Model
- E1 001 Layered Retrieval Design
- E1 002 Ann Abstraction Strategy
- E1 003 Tensor Summary Types
- E1 004 Lora Package Distinction
- E1 005 Model Switch Compatibility
- E1 006 Federated Tensor Summaries
- E2 001 Evaluation Framework Design
- E2 002 Hardware Profile Strategy
- E2 003 Query Planner Routing Model
- E2 004 Approximation Governance Rules
- E2 005 Cross Layer Fallback Confidence Policy
- E3 001 Distributed Tensor Design
- E3 002 Manifest Coordination Strategy
- E3 003 Recovery And Erasure Choice
- E3 004 Tensor Fabric Infrastructure
- Contributing
- Contributing (root)
- Code of Conduct
- Support
- Maintainers
- CTest Guide
- Build Quick Reference
- Developer Wiki Index
- Build / Test / CI
- Module Index
- Branching Strategy
- Disabled Stub Policy
- Docs PR Policy
- GA Promotion Sign Off
- Github Milestones Setup
- Maturity Claim Verification Checklist
- Maturity Evidence Registry
- Merge Gate Bot Config
- Merge Gate Status Live
- Phase 1 Closure Report
- Phase Closure Policy
- Phase Dependency Graph
- Phase3 Enforcement Runbook
- Plugin Submodule Rollback
- PR Version Targeting
- PR Version Targeting Backfill
- Production Ready 2026 Delivery Plan
- Query Module Status
- Readme
- Release Promotion Gate Policy
- Release Validation Checklist
- Security Module 5671 Evidence Summary
- Sharding P6 Residual Risk Acceptance
- Sourcecode Compliance Governance
- Updates Development Status Sign Off
- Wave C Implementation Complete
- Blob Storage
- Cuda
- Ethics Ai
- Exporters
- Huggingface
- Image Analysis
- Importers
- RPC
- Scraper
- Themisdb Ai Watermark Detector
- User Storage Encrypted
- Chimera Architecture
- Chimera Future
- Chimera Readme
- Chimera Roadmap
- Covina Fastapi Ingestion Architecture
- Covina Fastapi Ingestion Future
- Covina Fastapi Ingestion Roadmap
- Vcc Base Architecture
- Vcc Base Future
- Vcc Base Roadmap
- Vcc Clara Ingestion Architecture
- Vcc Clara Ingestion Future
- Vcc Clara Ingestion Roadmap
- Vcc Veritas Architecture
- Vcc Veritas Future
- Vcc Veritas Roadmap
- 01 Hello World
- 02 Todo App
- 03 Contact Manager
- 04 Inventory System
- 05 Time Series Monitor
- 06 Graph Social Network
- 07 Vector Search Documents
- 08 Dms Erp System
- 09 Iot Sensor Network
- 10 Drone Image Analysis
- 11 Blog Wiki
- 12 Expense Tracker
- 13 Recipe Manager
- 14 Ecommerce Catalog
- 15 Event Management
- 16 Kanban Board
- 17 Crm
- 18 Realtime Chat
- 19 Recommendation Engine
- 20 Smart Home
- 21 Coding Platform
- 22 AQL Diagram Tool
- 23 Traveling Salesman
- 24 Moral Philosophy Debates
- API Versioning
- Distributed Sharding
- Feedback Plugins
- Geo
- Gnn
- Image Analysis
- Legal Lora Training
- LLM
- Lora Sync
- Migration
- Nlp
- Performance
- Railway
- Replication
- Rope Visualization
- Sample Product Config
- Security
- Client SDK Overview
- Quickstart
- Sdk Enhancements
- Sdk Implementation Summary
- Test Suite Readme
- Go
- Java
- Javascript
- Php
- Python
- Ruby
- Rust
- Typescript
- 01 Grundlegende Operationen
- 02 AQL Queries
- 03 Graph Daten
- 04 Multimodell Anwendung
- 01 Quickstart Guide
- 02 AQL Referenz Kurzuebersicht
- 03 Datenmodellierung Guide
- 04 Uebungsaufgaben
- 05 Best Practices Guide
- Training Documents
- Training Overview
- 01 Einfuehrung Und Uebersicht
- 02 Datenmodelle Und Architektur
- 03 AQL Abfragesprache
- 04 Installation Und Setup
- 05 Anwendungsbeispiele
- Training Presentations
- Dependencies Readme
- Processmonitor Readme
- Themis.admintools.shared Readme
- Themis.aqlquerybuilder Readme
- Themis.aqlquerybuilder Roadmap
- Themis.auditlogviewer Readme
- Themis.auditlogviewer Roadmap
- Themis.classificationdashboard Readme
- Themis.classificationdashboard Roadmap
- Themis.compliancereports Readme
- Themis.compliancereports Roadmap
- Themis.gisviewer.controlpanel Readme
- Themis.gisviewer.controlpanel Roadmap
- Themis.impactanalysisviewer Readme
- Themis.impactanalysisviewer Roadmap
- Themis.ingestiontool Readme
- Themis.ingestiontool Roadmap
- Themis.keyrotationdashboard Readme
- Themis.keyrotationdashboard Roadmap
- Themis.piimanager Readme
- Themis.piimanager Roadmap
- Themis.retentionmanager Readme
- Themis.retentionmanager Roadmap
- Themis.sagaverifier Readme
- Themis.sagaverifier Roadmap
- Themis.usbadmintool Readme
- Themis.usbadmintool Roadmap
- CI Readme
- CI Roadmap
- Compiler Diagnostics Readme
- Compiler Diagnostics Roadmap
- Completion Readme
- Copilot Ollama Router Readme
- Copilot Ollama Router Roadmap
- Gnn Readme
- Gnn Roadmap
- Rope Visualizer Readme
- Rope Visualizer Roadmap
- Tco Calculator Readme
- Tco Calculator Roadmap
- Tests Readme
- Tests Roadmap
- Themis Config Wx Readme
- Themis Docs Builder Readme
- Wikipedia Ingestion Readme