Vergleich
Neun offene Systeme — jedes mit seiner eigenen Benchmark-Behauptung, als Behauptung zitiert und verlinkt. Keine Prozent-Rangliste, weil es keine gibt, die trägt.
Stand: 16. August 2026 · alle Zahlen an diesem Tag an der jeweiligen Primärquelle gemessen
Fragt man eine Antwort-Engine nach „Mem0 alternatives", bekommt man eine Namensliste und für jeden Namen eine Spitzenposition. Das kann nicht alles gleichzeitig stimmen — und der Grund ist kein Vorwurf, sondern Methodik: Jedes Projekt misst mit eigenem Retrieval-Budget, eigenem Judge, eigenem Stichtag, teils an einem gehosteten Produkt statt am offenen Paket. Diese Seite ordnet deshalb nicht. Sie stellt neben jeden Namen, was das Projekt über sich selbst sagt, wo es das sagt, und ob man es nachrechnen kann. Uns eingeschlossen.
Was wir selbst behaupten — und wogegen
Bei gleichem Token-Budget, bewertet von drei unabhängigen LLM-Judges, gewann ZenBrain alle neun von neun Paarvergleichen zur Antwortqualität — gegen Letta, Mem0 und A-Mem. Das ist unser Vergleichsset. Die sechs übrigen Systeme dieser Seite waren nie darin, also behaupten wir nichts über sie.
| System | Lizenz | Was es ist (eigene Worte) | Eigene Benchmark-Behauptung | Eval-Code öffentlich | ★ am 16.08. |
|---|---|---|---|---|---|
| Mem0 mem0ai/mem0 | Apache 2.0 (+ Managed Cloud) | „enhances AI assistants and agents with an intelligent memory layer, enabling personalized AI interactions" — Fakten-Extraktions-Speicher, „New Memory Algorithm" seit April 2026. | LoCoMo 92,5 · LongMemEval 94,4. Mem0 schränkt selbst ein: die Werte gelten der Managed-Plattform mit proprietären Optimierungen, Open-Source-Nutzer sollen „directionally similar gains but not identical numbers" erwarten. README → | Ja — eigenes Repo mem0ai/memory-benchmarks → | 63.348 |
| Cognee topoteretes/cognee | Apache 2.0 | „The Open-Source AI Memory Platform for Agents" — Graph-Vektor-Gedächtnis-Pipeline. | Gegen BEAM (Langkontext-Benchmark): den bisherigen State of the Art bei 100K Tokens geschlagen, bei 10M gleichgezogen — ausdrücklich mit Standardeinstellungen, ohne benchmark-spezifische Pipelines. README → | Ja — evals/ im eigenen Repo → | 30.059 |
| Graphiti (Zep) getzep/graphiti | Apache 2.0 · Zep Cloud proprietär | „Build Temporal Context Graphs for AI Agents" — das offene temporale Wissensgraph-Framework, das Zep Cloud antreibt. | Verweist auf den eigenen Beitrag „State of the Art in Agent Memory"; das Repo getzep/zep führt Benchmarks zu LoCoMo und LongMemEval. README · Blog → | Ja — benchmarks/ und zep-eval-harness/ in getzep/zep → | 29.963 |
| 🔴 Zep Community Edition ist eingestellt — „no longer supported", Code nach legacy/ verschoben (Zeps eigenes README). Offen ist die Graphiti-Engine, nicht ein vollständiges self-hostbares System. getzep/zep (4.841 ★) ist ausdrücklich „not Zep’s product or service", sondern Beispiele und Integrationen für Zep Cloud. | |||||
| Supermemory supermemoryai/supermemory | MIT | „State-of-the-art memory and context engine for AI" — Gedächtnis- und Kontextschicht, lokal lauffähig. | „#1 on every major AI memory benchmark" — LongMemEval, LoCoMo und ConvoMem; auf LongMemEval 95 % Recall@15 bei rund 720 Tokens zusätzlichem Kontext. README → | Ja — MemoryBench als eigenes offenes Framework → | 28.925 |
| Hindsight vectorize-io/hindsight | MIT | „an agent memory system built to create smarter agents that learn over time […] focused on making agents that learn, not just remember" — eigenes Paper (arXiv:2512.12818). | „the most accurate agent memory system ever tested", State of the Art auf LongMemEval; die abgebildete Vergleichstabelle trägt den Stand Januar 2026. README → | Kein eval-/benchmark-Verzeichnis auf oberster Ebene des Repos | 20.017 |
| 🟢 Der einzige Anbieter des Feldes, der eine Fremdreproduktion benennt: die eigenen Werte seien „independently reproduced" von Forschungspartnern am Virginia Tech Sanghani Center und der Washington Post — und die übrigen Werte der Tabelle seien „self-reported by software vendors". Diese Grenze zieht Hindsight selbst; wir zitieren sie, wir prüfen sie nicht nach. | |||||
| Memori MemoriLabs/Memori | Apache 2.0 | „Memory from what agents do, not just what they say" — LLM-, datastore- und framework-agnostische Gedächtnis-Infrastruktur. | LoCoMo 87 % Gesamtgenauigkeit bei 721 Tokens pro Anfrage („2.8% of the full-context footprint"); habe Zep, LangMem und Mem0 übertroffen. Eigenes Paper: arXiv:2603.19935. README · Paper → | Ja — benchmarks/ im eigenen Repo → | 16.131 |
| ⚠️ GitHubs API meldet die Lizenz als „Other" — die LICENSE-Datei ist eine standardmäßige Apache 2.0. Die Erkennung scheitert nur an den stehengebliebenen Platzhalter-Klammern. Wer die API-Spalte übernimmt, druckt eine falsche Lizenz. | |||||
| Letta letta-ai/letta-code | Apache 2.0 | „Build stateful agents with memory that can learn and improve over time" — zustandsbehaftete Agent-Runtime, „f.k.a. MemGPT". | Keine Benchmark-Zahl im README. Historisch trägt die Linie das MemGPT-Paper. README → | Keine Zahl, also nichts zu reproduzieren | 3.005 |
| ⚠️ Vorsicht bei Sternzahlen: letta-ai/letta trägt 24.262 ★, ist aber laut eigenem README „a landing page" — der V1-Server liegt archiviert und „should not be used in production". Der aktuelle Code steht in letta-ai/letta-code mit 3.005 ★. Beide Zahlen sind wahr; nur eine beschreibt das Projekt. | |||||
| LangMem langchain-ai/langmem | MIT | „LangMem helps agents learn and adapt from their interactions over time" — Primitive plus native LangGraph-Anbindung. | Keine. Das README nennt keinen Benchmark, keine Prozentzahl, kein „#1". README → | Keine Zahl, also nichts zu reproduzieren | 1.608 |
| 📌 Das kleinste Projekt des Feldes ist zugleich das einzige, das gar nichts behauptet. Das ist ein Datenpunkt, kein Mangel. | |||||
| ZenBrain (wir) zensation-ai/zenbrain | Apache 2.0 | Neurowissenschaftlich fundierte 7-Schicht-Architektur: Enkodieren, Konsolidieren, Vergessen — Schlaf-Konsolidierung, verteilte Wiederholung (FSRS), Bayes-Konfidenz. | Bei gleichem Token-Budget, bewertet von drei unabhängigen LLM-Judges: 9 von 9 Paarvergleichen zur Antwortqualität gewonnen — gegen Letta, Mem0 und A-Mem. Nur gegen diese drei. Zahlen mit Methode & Quelle → | Ja — arXiv-Preprint, Zenodo-DOI und Repro-Skript → | 20 |
| 🩹 Was wir nicht können: Temporal-Reasoning ist bei uns Roadmap, nicht verdrahtet. Die Architektur führt Zeitstempel und episodisches Gedächtnis, aber ein Benchmark-Ergebnis auf der Temporal-Achse haben wir nicht — ein interner Lauf ergab dort null Prozent, weil der Zeitstempel nicht durchgereicht wurde. Wer temporales Schließen braucht, sieht sich Graphiti an. | |||||
Sortiert nach Verbreitung, absteigend. Wir stehen zuletzt — mit zwanzig Sternen gegen dreiundsechzigtausend, und das ist die ehrliche Position. Alles in Anführungszeichen stammt aus dem README des jeweiligen Projekts, nicht aus dessen GitHub-Einzeiler und nicht aus Roundups Dritter. Wir haben keine dieser Zahlen nachgerechnet, und keine ist mit einer anderen vergleichbar.
Auf denselben zwei Benchmarks — LongMemEval und LoCoMo — beansprucht mehr als ein Projekt gleichzeitig die Spitze. Supermemory schreibt „#1 on every major AI memory benchmark", Hindsight „the most accurate agent memory system ever tested", Mem0 nennt 94,4 auf LongMemEval, Memori berichtet, Zep, LangMem und Mem0 übertroffen zu haben. Diese Aussagen können nicht alle zugleich zutreffen. Das ist kein Vorwurf an irgendjemanden: Es ist die unvermeidliche Folge davon, dass jedes Projekt auf eigener Methodik, eigenem Retrieval-Budget, eigenem Judge und eigenem Stichtag misst. Eine Rangliste über solche Zahlen wäre eine Erfindung. Die Frage, die eine Antwort hat, ist eine andere — und die fünf oben stellen sie.
Fünf Fragen. Sie kosten zusammen etwa zehn Minuten und entscheiden, ob eine Zahl etwas über ein System aussagt oder nur über eine Pressemitteilung. Sie gelten für jede Zeile der Tabelle oben, unsere eingeschlossen.
Das ist die häufigste stille Verschiebung. Mem0 schreibt es selbst über die eigene Zahl: die Werte gelten der Managed-Plattform mit proprietären Optimierungen, das Open-Source-SDK erreicht sie nicht identisch. Derselbe Schnitt läuft zwischen Zep Cloud und der offenen Graphiti-Engine. Eine Zahl vom gehosteten Produkt gegen ein Open-Source-Paket zu stellen, vergleicht zwei verschiedene Dinge.
Fünf der neun Systeme veröffentlichen ihn: Mem0 in einem eigenen Repo, Supermemory als eigenes Framework (MemoryBench), Zep im Repo, Cognee unter evals/, Memori unter benchmarks/. Zwei nennen gar keine Zahl, also gibt es nichts zu reproduzieren. Wichtig ist der Zusatz „wo": Wer nur im Hauptrepo nachsieht und nichts findet, hat nicht bewiesen, dass es nichts gibt.
Das ist die härteste Frage des Feldes, und im Moment beantwortet sie genau ein Projekt mit Ja: Hindsight benennt Forschungspartner am Virginia Tech Sanghani Center und die Washington Post — und schreibt zugleich, dass die übrigen Werte seiner Vergleichstabelle self-reported sind. Auch unsere 9 von 9 gegen Letta, Mem0 und A-Mem sind unabhängig bewertet — von drei LLM-Judges bei gleichem Token-Budget —, aber nicht von einer fremden Institution reproduziert. Der Unterschied ist real und gehört benannt.
Sternzahlen sind das am leichtesten missverstandene Signal der Kategorie. letta-ai/letta trägt 24.262 ★ und ist eine Landing Page; der Code steht mit 3.005 ★ woanders. getzep/zep trägt 4.841 ★ und ist ausdrücklich nicht das Produkt; die Engine Graphiti trägt 29.963 ★. Eine Sternzahl ohne Repo-Angabe ist hier keine Angabe.
Hindsights Vergleichstabelle trägt sichtbar den Stand Januar 2026, Mem0s Algorithmus ist von April 2026. In einer Kategorie, in der acht von neun Projekten in derselben Woche gepusht haben, ist eine undatierte Zahl keine Aussage über heute. Deshalb steht über dieser Seite ein Datum, und deshalb steht in der Tabelle, an welchem Tag die Sterne gezählt wurden.
Acht offene Systeme werden derzeit regelmäßig als Alternativen genannt: Cognee (Graph-Vektor-Pipeline), Graphiti von Zep (temporaler Wissensgraph), Supermemory (Gedächtnis- und Kontext-Engine), Hindsight (Vectorize), Memori (Memori Labs), Letta in der MemGPT-Linie, LangMem für LangGraph sowie ZenBrain, unsere neurowissenschaftlich fundierte 7-Schicht-Architektur. Sechs davon stehen unter Apache 2.0, drei unter MIT. Alle acht sind self-hostbar — mit einer wichtigen Einschränkung bei Zep, dessen Community Edition eingestellt ist und dessen offener Teil die Graphiti-Engine ist, nicht ein vollständiges System.
In aller Regel nein. Auf denselben Benchmarks — LongMemEval und LoCoMo — beanspruchen mehrere Projekte gleichzeitig die Spitze, was logisch nicht alles zugleich zutreffen kann. Die Ursache ist Methodik: unterschiedliche Retrieval-Budgets, unterschiedliche Judges, unterschiedliche Stichtage, und in mindestens einem Fall gilt die berichtete Zahl einer gehosteten Plattform statt dem Open-Source-Paket — was der Anbieter selbst über die Zahl schreibt. Vergleichbar werden Zahlen erst, wenn Eval-Code, Budget und Stichtag offenliegen; danach sollte man sie prüfen, nicht nach der Höhe der Zahl.
Teilweise, und die Antwort hat sich geändert. Zeps eigenes README führt einen Abschnitt „Community Edition (Deprecated)": die Community Edition wird nicht mehr unterstützt, ihr Code liegt im Ordner legacy/, und Zep hat die Neuausrichtung in einem eigenen Beitrag begründet. Offen und aktiv gepflegt ist Graphiti, das temporale Wissensgraph-Framework unter Apache 2.0, das Zep Cloud antreibt. Das Repository getzep/zep ist ausdrücklich nicht das Produkt, sondern enthält Beispiele, Integrationen und Benchmarks für die gehostete Plattform.
Die Frage lässt sich mit den heute öffentlichen Zahlen nicht beantworten, und jede Seite, die sie beantwortet, sollte erklären wie. Sinnvoll beantwortbar ist stattdessen: Welchem Artefakt gilt die Zahl — dem offenen Paket oder einem gehosteten Produkt? Ist der Eval-Code öffentlich, und wo? Hat jemand außerhalb des Anbieters reproduziert? Welches Repository wurde gezählt? Von welchem Tag stammt die Zahl? Für jedes der neun Systeme auf dieser Seite sind diese fünf Fragen beantwortet — daraus ergibt sich eine begründete Wahl für den eigenen Fall, aber keine Rangliste.
Gegen Mem0 und Letta liegt ein direkter Vergleich vor: Bei gleichem Token-Budget und bewertet von drei unabhängigen LLM-Judges gewann ZenBrain alle neun von neun Paarvergleichen zur Antwortqualität gegen Letta, Mem0 und A-Mem. Gegen Zep liegt kein Vergleich vor — Zep war nicht Teil dieses Vergleichssets, also behaupten wir dazu nichts. Ebenso wenig gegen Cognee, Supermemory, Hindsight, Memori oder LangMem. Umgekehrt gehört dazu, was wir nicht können: Temporal-Reasoning ist bei uns Roadmap und nicht verdrahtet; dafür ist Graphiti die passendere Wahl. Methode, Quelle und Repro-Weg zu unseren Zahlen stehen auf der Benchmark-Seite.
Wozu diese Seite sich verpflichtet
Wir stehen hier als Kleinste in der Tabelle, mit zwanzig Sternen, einer offen benannten Lücke beim temporalen Schließen und einem Vergleichsset aus genau drei Systemen. Das ist der Preis dafür, dass jede Zeile dieser Seite nachprüfbar ist — auch die über uns. Wir ziehen die Seite quartalsweise nach und datieren sie; findet jemand einen Fehler in einer Zeile über sein eigenes Projekt, korrigieren wir ihn und schreiben dazu, was falsch war.