The AI coding models developers trust right now.

Real developers set the ranking. No lab scores. No synthetic benchmarks.

Report from your terminal.

Install once, connect your tools, and submit only confirmed ratings on Linux, macOS, or Windows.

Open source and local-only. No code or prompts collected. View source ↗

isaiokay
  1. 01Install the CLI
    npm install --global @isaiokay/cli

    Same CLI via npm, pnpm, or Bun.

  2. 03Use your normal CLI
    codex

    Keep using Codex, Claude, Cursor, or another harness. Eligible questionnaires open after a session.

More setup options
Headless setup
isaiokay setup --headless

Open the link on any device. First-time auth still needs GitHub in a browser.

Connect everything detected
isaiokay install --all

Install every supported, unconfigured integration.

Preview without installing
npx --yes @isaiokay/cli --help

Also: pnpm dlx @isaiokay/cli --help or bunx @isaiokay/cli --help.

Coding models
Current developer experience ratings for AI coding models. Select a model to expand its recent and release evidence.
RankModelDeveloper SignalTrend (7d)StatusConfidenceDevelopersRate
165/100
No move
Stable1 developer2 ratingsRate
262/100
No move
Stable1 developer2 ratingsRate
360/100
No move
Stable1 developer3 ratingsRate
462/100
No move
Stable1 developer1 ratingRate
5Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
6Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
7Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
8Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
9Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
10Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
11Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
12Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
Recent experience evidence

Release window did not collect enough evidence. A possible regression is a community signal, never a claim about provider intent.

Rate GLM-5.2
Seven-day trendResult quality vs prior window: 0.0
Dimension scores
Result quality PendingUsage efficiency Pending
Usage pressure

Usage efficiency pending

How much useful progress developers felt they received for the subscription or usage consumed.

Release signal

Release window did not collect enough evidence

View release referenceOfficial model page
13Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
14Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
15Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
16Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
17Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
18Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
19Pending
Awaiting ratings
Collecting0 developers0 ratingsRate
12Z.ai logoGLM-5.2by Z.aiPending
Awaiting ratings
StatusCollectingDevelopers0Ratings0Confidence
Result quality Pending
Usage efficiency Pending

Release window did not collect enough evidence

Rate GLM-5.2
View full history for GLM-5.2
13OpenAI logoGPT-5by OpenAIPending
Awaiting ratings
StatusCollectingDevelopers0Ratings0Confidence
Result quality Pending
Usage efficiency Pending

No documented release baseline yet

Rate GPT-5
View full history for GPT-5
17Kimi logoKimi K3by KimiPending
Awaiting ratings
StatusCollectingDevelopers0Ratings0Confidence
Result quality Pending
Usage efficiency Pending

Release window did not collect enough evidence

Rate Kimi K3
View full history for Kimi K3

Scoring methodology

Developer Signal rewards a strong recent experience only when enough independent evidence supports it. The scoring specification lives here with the ranking it explains.

1

Weighted rating

Each eligible rating is normalized to a 0–100 scale, then combined across two deliberately distinct measurements.

Result quality
70%
Usage efficiency
30%
1 → 0 · 2 → 25 · 3 → 50 · 4 → 75 · 5 → 100
2

Confidence and breadth

Bayesian stabilization keeps sparse evidence cautious while independent developer participation strengthens the signal.

Evidence weight
recency × trust × (1 − fraud risk) × duplicate adjustment
Moderation
Excluded reports contribute nothing.
3

Recency and guardrails

Newer experience matters most, with safeguards for low-signal periods and documented model releases.

Live recency
2 ^ (−age in days / half-life days)
Half-life
Configurable 14 days, with no midnight reset.
Regression
Requires current confidence and a qualified release baseline.

72% weighted rating18% confidence10% breadth

Note: Only models are ranked. Coding agents such as Codex, Claude Code, Cursor, and OpenCode remain optional report context. Community ratings describe developer experience, not an objective benchmark or provider intent.

Want to rate Grok 4.6? Sign in with GitHub to report how the model felt and which coding agent you used.