---
type: "Comparison"
title: "pi vs Codex CLI (2026): Minimal-Harness gegen OpenAIs Plattform-Harness — wer die Agent-Loop besitzt"
description: "Pi vs Codex CLI"
resource: "https://www.contextstudios.ai/de/vergleich/pi-vs-codex-cli"
language: "de"
generated:
  by: "process:contextstudios-md/1"
  at: "2026-10-09T22:36:12.094Z"
status: "stable"
---

# pi vs Codex CLI (2026): Minimal-Harness gegen OpenAIs Plattform-Harness — wer die Agent-Loop besitzt

pi (von Mario Zechner/Earendil, MIT-lizenziertes TypeScript) ist ein minimaler Agent-Harness: vier Werkzeuge — read, write, edit, bash — Sessions als Baum, 15+ Provider und Modellwechsel mitten in der Session, mit rund 1.000 Tokens festem System-Prompt- und Tool-Overhead. Codex CLI (OpenAI) ist ein Plattform-Harness in Rust: codex-core bringt OS-Sandbox, Subagenten, Cloud-Tasks und Modelle, die auf den Harness hineingetrageniert wurden (GPT-5.3-Codex half beim Debuggen von Codex). Die eigentliche Frage ist nicht „wer codet besser", sondern: Wer bezahlt welchen Context-Footprint — und wer entscheidet, was im Kontextfenster landet?

## Unsere Empfehlung

Ein 30-Aufgaben-Eval auf DeepSeek V4 Pro (max Reasoning) bei Composio: pi löste 21/30 Aufgaben, Codex 20/30 — bei identischen 0,031 $ pro gemeinsam gelöster Aufgabe. Aber Codex verbrauchte ~2,4-mal weniger Tokens pro Aufgabe (383.722 vs. 924.990; pi mittelte 16,3 Turns und lief einfach weiter). Im Databricks-Benchmark über eine Millionen-Zeilen-Codebasis (Opus 4.8, xhigh) hatte pi die höchste Bestehensquote aller getesteten Harnesses — bei ~3-mal weniger Context pro Turn und etwa der halben Kosten gegenüber Claude Code und Codex. Lesson from both runs: dünner Overhead heißt nicht automatisch schlanke Sessions — ein dünner Harness gewinnt erst, wenn das Modell weniger Turns braucht. Preismodell: pi selbst ist gratis, die Modelle bezahlt man beim Provider des Vertrauens — subscription-OAuth via /login (Anthropic-Abo direkt, API-Keys für 15+ Provider), günstig bis DeepSeek und GLM; Codex rechnet pro Request ab, im Plus-Plan grob 20 Codex-Requests im Monat, im Pro-Plan 900 (geteilt mit Codex Desktop, Modelle GPT-5.x mit 128k Kontext und 32k Output). Empfehlung: Wer Codex hat, lässt es für delegierte, unbeaufsichtigte und parallele Läufe laufen (Sandbox, Cloud, Subagenten, CI/Slack sind eingebaut); wer pi nimmt, holt sich Auditierbarkeit und Modell-Hoheit — und ersetzt damit keine TypeScript-Kultur, Verifizierung ist Eigenbau. Für 2026 ist die ehrliche Empfehlung beides zu testen: die zehn eigenen Tasks auf beiden Harnesses laufen lassen und Tokens pro Aufgabe zählen, statt Marketing-Benchmarks zu vertrauen. Glossar-Bezug: [Agent Harness](/de/glossar/agent-harness) · [Model Context Protocol](/de/glossar/model-context-protocol) · [Context Engineering](/de/glossar/context-engineering)
