Technologie

pi vs Codex CLI (2026): Minimal-Harness gegen OpenAIs Plattform-Harness — wer die Agent-Loop besitzt

Geprüft von Michael Kerkhoff, Stand

Definition
pi (von Mario Zechner/Earendil, MIT-lizenziertes TypeScript) ist ein minimaler Agent-Harness: vier Werkzeuge — read, write, edit, bash — Sessions als Baum, 15+ Provider und Modellwechsel mitten in der Session, mit rund 1.000 Tokens festem System-Prompt- und Tool-Overhead. Codex CLI (OpenAI) ist ein Plattform-Harness in Rust: codex-core bringt OS-Sandbox, Subagenten, Cloud-Tasks und Modelle, die auf den Harness hineingetrageniert wurden (GPT-5.3-Codex half beim Debuggen von Codex). Die eigentliche Frage ist nicht „wer codet besser", sondern: Wer bezahlt welchen Context-Footprint — und wer entscheidet, was im Kontextfenster landet?
Kategorie
Technologie
Optionen
PiCodex CLI

Detaillierter Vergleich

Eine Gegenüberstellung der wichtigsten Faktoren für Ihre Entscheidung.

Pi vs Codex CLI
FaktorPiCodex CLI

Wann Sie welche Option wählen sollten

Klare Orientierung basierend auf Ihrer spezifischen Situation und Ihren Bedürfnissen.

Unsere Empfehlung

Ein 30-Aufgaben-Eval auf DeepSeek V4 Pro (max Reasoning) bei Composio: pi löste 21/30 Aufgaben, Codex 20/30 — bei identischen 0,031 $ pro gemeinsam gelöster Aufgabe. Aber Codex verbrauchte ~2,4-mal weniger Tokens pro Aufgabe (383.722 vs. 924.990; pi mittelte 16,3 Turns und lief einfach weiter). Im Databricks-Benchmark über eine Millionen-Zeilen-Codebasis (Opus 4.8, xhigh) hatte pi die höchste Bestehensquote aller getesteten Harnesses — bei ~3-mal weniger Context pro Turn und etwa der halben Kosten gegenüber Claude Code und Codex. Lesson from both runs: dünner Overhead heißt nicht automatisch schlanke Sessions — ein dünner Harness gewinnt erst, wenn das Modell weniger Turns braucht. Preismodell: pi selbst ist gratis, die Modelle bezahlt man beim Provider des Vertrauens — subscription-OAuth via /login (Anthropic-Abo direkt, API-Keys für 15+ Provider), günstig bis DeepSeek und GLM; Codex rechnet pro Request ab, im Plus-Plan grob 20 Codex-Requests im Monat, im Pro-Plan 900 (geteilt mit Codex Desktop, Modelle GPT-5.x mit 128k Kontext und 32k Output). Empfehlung: Wer Codex hat, lässt es für delegierte, unbeaufsichtigte und parallele Läufe laufen (Sandbox, Cloud, Subagenten, CI/Slack sind eingebaut); wer pi nimmt, holt sich Auditierbarkeit und Modell-Hoheit — und ersetzt damit keine TypeScript-Kultur, Verifizierung ist Eigenbau. Für 2026 ist die ehrliche Empfehlung beides zu testen: die zehn eigenen Tasks auf beiden Harnesses laufen lassen und Tokens pro Aufgabe zählen, statt Marketing-Benchmarks zu vertrauen. Glossar-Bezug: [Agent Harness](/de/glossar/agent-harness) · [Model Context Protocol](/de/glossar/model-context-protocol) · [Context Engineering](/de/glossar/context-engineering)

Wählen Sie Pi, wenn...
    Wählen Sie Codex CLI, wenn...

      Brauchen Sie Hilfe bei der Entscheidung?

      Buchen Sie ein kostenloses 30-minütiges Beratungsgespräch und wir helfen Ihnen, den besten Ansatz für Ihr Projekt zu bestimmen.

      Kostenlose Beratung · Unverbindlich · Persönliche Antwort