Qu'est-ce qu'Ox Alpha ? Le modèle furtif révélé comme Z.ai GLM-5.3-Flash
Ox Alpha était le nom anonyme de Z.ai GLM-5.3-Flash sur OpenRouter et OpenCode. Qui l'a créé, ses specs, s'il est encore gratuit et comment l'utiliser.
Lire en MarkdownOx Alpha était le nom de test anonyme de GLM-5.3-Flash, un modèle de code et d'agents de Z.ai. Il est apparu sur OpenRouter et OpenCode comme modèle « furtif » (stealth) le 20 août 2026, sans qu'aucun créateur ne soit nommé. Le 26 août, Z.ai a publié GLM-5.3-Flash et confirmé qu'il s'agissait d'Ox Alpha. Le nom ox-alpha ne fonctionne plus ; pour utiliser le même modèle aujourd'hui, appelez GLM-5.3-Flash. Chaque information ci-dessous provient de Z.ai, d'OpenRouter ou d'OpenCode, vérifiée le 29 septembre 2026.
Qui a créé Ox Alpha ?
Z.ai. Son billet de lancement de GLM-5.3-Flash indique qu'avant la sortie, l'entreprise a « testé GLM-5.3-Flash anonymement sous le nom ox-alpha sur OpenCode et OpenRouter pour recueillir les retours des utilisateurs », et qu'« il est rapidement devenu le modèle le plus populaire de la semaine ».
La page d'OpenRouter consacrée au modèle le confirme : « Ce modèle furtif a été développé et exploité par ZAI, et s'est révélé être ZAI GLM-5.3-Flash. » OpenCode liste désormais le modèle sous le nom GLM-5.3-Flash, « anciennement ox-alpha ».
Tant qu'il était anonyme, les utilisateurs pensaient à Gemini, à un modèle GLM et à d'autres. L'hypothèse GLM était proche mais pas exacte : Ox Alpha est GLM-5.3-Flash, et non GLM-5.3, que Z.ai a publié séparément comme modèle texte uniquement.
Qu'était un « modèle furtif » ?
Un modèle qu'un laboratoire met sur une plateforme publique sous un nom de code avant son lancement, pour recueillir un usage réel et des retours. OpenRouter héberge ces modèles sous le préfixe stealth/ ; l'ID d'Ox Alpha était stealth/ox-alpha. Quand le laboratoire annonce le modèle, OpenRouter révèle son créateur et renvoie vers le vrai nom du modèle.
Quelles sont les caractéristiques d'Ox Alpha ?
Voici les caractéristiques publiées de GLM-5.3-Flash, le modèle derrière Ox Alpha :
| Caractéristique | Valeur |
|---|---|
| Développeur | Z.ai |
| Sortie furtive | 20 août 2026, sur OpenRouter et OpenCode |
| Sortie officielle | 26 août 2026, sous le nom GLM-5.3-Flash |
| Paramètres | 320B au total, 18B actifs |
| Architecture | « Une architecture hybride combinant attention clairsemée et attention linéaire » |
| Fenêtre de contexte | 1 048 576 tokens (1M) |
| Sortie maximale | 128K tokens |
| Entrée | Texte, images et vidéo (la documentation de Z.ai liste aussi les fichiers) |
| Sortie | Texte |
| Poids | Publics sur Hugging Face sous licence MIT |
| ID du modèle | glm-5.3-flash sur l'API de Z.ai ; z-ai/glm-5.3-flash sur OpenRouter |
OpenRouter décrivait Ox Alpha comme « un modèle de raisonnement conçu pour le code, le travail agentique prolongé et les charges de production ». Pour comprendre comment la fenêtre de contexte et la limite de sortie fonctionnent ensemble, voir fenêtre de contexte vs tokens de sortie max.
Ox Alpha est-il performant ?
Z.ai a publié cette comparaison dans son billet de lancement de GLM-5.3-Flash :
| Benchmark | GLM-5.3-Flash | GLM-5.2 | Claude Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 84.3 | 81.0 | 85.0 | 87.4 | 85.8 |
| DeepSWE v1.1 | 63.4 | 46.2 | 58.0 | 69.6 | 65.3 |
| AutomationBench v1.0.6 | 48.8 | 26.2 | 41.0 | 37.2 | 52.3 |
Z.ai le résume comme « approchant Claude Opus 4.8 dans l'ensemble ». Il ajoute que sur son benchmark interne Z.ai Code Bench v1.0, le modèle « à l'effort maximal égale presque Claude Opus 4.8 (29.0 contre 29.5) », et qu'il obtient 57 à l'Artificial Analysis Intelligence Index v4.1.1 « pour seulement $0,045 par tâche (tarif réduit) ».
Ce sont les résultats du développeur lui-même, sur des benchmarks qu'il a choisis. Testez le modèle sur vos propres tâches avant de vous y fier.
Ox Alpha est-il encore gratuit ?
Non, et le nom ox-alpha lui-même a disparu. La fiche stealth/ox-alpha d'OpenRouter n'a plus aucun point de terminaison actif, et le modèle n'apparaît plus dans sa liste de modèles. Le test a duré du 20 août jusqu'au lancement de GLM-5.3-Flash par Z.ai le 26 août. Comme la fiche a disparu, le prix pendant le test ne peut plus être vérifié ni sur OpenRouter ni chez Z.ai.
GLM-5.3-Flash est désormais un modèle payant. La page de tarifs de Z.ai l'affiche à $0,15 par million de tokens d'entrée, $0,03 par million de tokens d'entrée en cache et $0,50 par million de tokens de sortie. OpenRouter affiche les mêmes tarifs d'entrée et de sortie pour z-ai/glm-5.3-flash. Les prix évoluent : vérifiez les deux pages avant de vous engager.
Comment utiliser Ox Alpha aujourd'hui ?
Appelez GLM-5.3-Flash sous son vrai nom. Il y a trois moyens :
- L'API de Z.ai, avec le code de modèle
glm-5.3-flash. - OpenRouter, avec l'ID de modèle
z-ai/glm-5.3-flash. - OpenCode, où le modèle apparaît désormais sous le nom GLM-5.3-Flash.
Les agents de code qui permettent de définir une URL de base et un nom de modèle peuvent l'utiliser via l'une ou l'autre API. Z.ai a aussi publié une variante plus récente, GLM-5.3-FlashX ; son code de modèle est glm-5.3-flashx.
Puis-je exécuter Ox Alpha en local ?
Les poids sont publics. Le billet de lancement de Z.ai indique : « Les poids du modèle GLM-5.3-Flash sont publiquement disponibles sur Hugging Face. » La fiche du modèle mentionne la licence MIT. Avec 320 milliards de paramètres au total, l'exécuter demande du matériel multi-GPU de niveau data center, même si seuls 18 milliards sont actifs par token : la plupart des gens l'appellent donc via une API.
Mes prompts ont-ils été conservés quand c'était un modèle furtif ?
La page d'OpenRouter indique que les prompts et les réponses de ce modèle « ont été conservés » par l'entreprise qui l'exploitait, Z.ai, et « ne sont pas utilisés pour l'entraînement ». Si vous avez envoyé du code privé à Ox Alpha via OpenRouter, partez du principe que Z.ai l'a conservé.
Quelles alternatives à Ox Alpha pour les agents de code ?
Si vous voulez un modèle de code que vous pouvez appeler depuis Claude Code ou Codex avec une seule clé et une facturation à l'usage, ces modèles sont disponibles sur SeedRouter aujourd'hui :
- DeepSeek V4.1 Flash, le modèle rapide et économique de DeepSeek, avec un contexte de 1M tokens. Configuration : DeepSeek V4.1 Flash dans Claude Code et Codex.
- Kimi K3, le modèle à poids ouverts de Moonshot AI pour les longues sessions de code. Configuration : Kimi K3 dans Claude Code et Codex.
- GPT-6, GPT-6 Astra, Sol et Luna d'OpenAI. Configuration : GPT-6 dans Codex.
SeedRouter ne sert pas GLM-5.3-Flash. Vous rechargez une fois, sans abonnement, les crédits n'expirent jamais, et une requête qui échoue n'est pas facturée. Les prix actuels sont sur chaque page modèle.
Questions fréquentes
Ox Alpha est-il un GLM ?
Oui. Ox Alpha était GLM-5.3-Flash de Z.ai. Z.ai l'a confirmé au lancement du modèle le 26 août 2026, et la page d'OpenRouter dit désormais la même chose.
Ox Alpha est-il chinois ?
Il a été créé par Z.ai, qui indique que tout le trafic de la phase furtive était « servi sur des puces d'IA chinoises ».
Ox Alpha est-il open source ?
Ses poids, oui. GLM-5.3-Flash est sur Hugging Face sous licence MIT.
Pourquoi Ox Alpha a-t-il disparu ?
Parce que le test s'est terminé. Quand Z.ai a lancé GLM-5.3-Flash, le nom ox-alpha a été retiré et le modèle est passé à son vrai nom.
Ox Alpha est-il meilleur que Claude ?
Z.ai affirme que GLM-5.3-Flash à l'effort maximal « égale presque Claude Opus 4.8 » sur son propre Code Bench. C'est un seul benchmark, publié par le développeur du modèle, pas une comparaison indépendante.



