1
Grok 4.6by xAI65/100
Release window did not collect enough evidence
Rate Grok 4.6Real developers set the ranking. No lab scores. No synthetic benchmarks.
Install once, connect your tools, and submit only confirmed ratings on Linux, macOS, or Windows.
Open source and local-only. No code or prompts collected. View source ↗
npm install --global @isaiokay/cliSame CLI via npm, pnpm, or Bun.
Copy to reveal next step
isaiokaySign in with GitHub, connect detected coding CLIs, and enable automatic questionnaires.
Copy to reveal next step
codexKeep using Codex, Claude, Cursor, or another harness. Eligible questionnaires open after a session.
isaiokay setup --headlessOpen the link on any device. First-time auth still needs GitHub in a browser.
isaiokay install --allInstall every supported, unconfigured integration.
npx --yes @isaiokay/cli --helpAlso: pnpm dlx @isaiokay/cli --help or bunx @isaiokay/cli --help.
| Rank | Model | Developer Signal | Trend (7d) | Status | Confidence | Developers | Rate |
|---|---|---|---|---|---|---|---|
| 1 | 65/100 | No move | Stable | 1 developer2 ratings | Rate | ||
| 2 | 62/100 | No move | Stable | 1 developer2 ratings | Rate | ||
| 3 | 60/100 | No move | Stable | 1 developer3 ratings | Rate | ||
| 4 | 62/100 | No move | Stable | 1 developer1 rating | Rate | ||
| 5 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
| 6 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
| 7 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
| 8 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
| 9 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
| 10 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
| 11 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
| 12 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
| 13 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
| 14 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
| 15 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
| 16 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
| 17 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
| 18 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
| 19 | Pending | Awaiting ratings | Collecting | 0 developers0 ratings | Rate | ||
Release window did not collect enough evidence
Rate Grok 4.6Release window did not collect enough evidence
Rate Claude Sonnet 5Release window did not collect enough evidence
Rate GPT-5.6 SolRelease window did not collect enough evidence
Rate DeepSeek V4 FlashRelease window did not collect enough evidence
Rate Claude Fable 5Release window did not collect enough evidence
Rate Claude Opus 5Release window did not collect enough evidence
Rate Composer 2.5Release window did not collect enough evidence
Rate DeepSeek V4 ProNo documented release baseline yet
Rate Gemini 3.1 ProRelease window did not collect enough evidence
Rate Gemini 3.5 FlashNo documented release baseline yet
Rate Gemini 3.6 FlashRelease window did not collect enough evidence
Rate GLM-5.2No documented release baseline yet
Rate GPT-5Release window did not collect enough evidence
Rate GPT-5.6 LunaRelease window did not collect enough evidence
Rate GPT-5.6 TerraRelease window did not collect enough evidence
Rate Kimi K2.7 CodeRelease window did not collect enough evidence
Rate Kimi K3Release window did not collect enough evidence
Rate MiniMax M3Release window did not collect enough evidence
Rate Qwen 3.8 MaxDeveloper Signal rewards a strong recent experience only when enough independent evidence supports it. The scoring specification lives here with the ranking it explains.
Each eligible rating is normalized to a 0–100 scale, then combined across two deliberately distinct measurements.
1 → 0 · 2 → 25 · 3 → 50 · 4 → 75 · 5 → 100Bayesian stabilization keeps sparse evidence cautious while independent developer participation strengthens the signal.
recency × trust × (1 − fraud risk) × duplicate adjustmentNewer experience matters most, with safeguards for low-signal periods and documented model releases.
2 ^ (−age in days / half-life days)72% weighted rating18% confidence10% breadth
Note: Only models are ranked. Coding agents such as Codex, Claude Code, Cursor, and OpenCode remain optional report context. Community ratings describe developer experience, not an objective benchmark or provider intent.