Upstage

Solar Pro 4

UpstageÉquilibré
RaisonnementOutilsSortie structurée

À propos de ce modèle

Solar Pro 4 is Upstage's cost-efficient large language model, featuring a 524K context window. It is built for long-horizon tasks and agentic workflows, with strong capabilities in office productivity, document-intensive...

Catégorie de performance

Équilibré

Solar Pro 4 est un modèle équilibré de Upstage : un bon compromis entre bonnes performances à un prix raisonnable.

Bon rapport coût-performance. Fiable pour la plupart des usages professionnels sans tarification premium.

Tarification

Ce modèle est inclus dans les plans Elosia
Éco

Coût minimal. Idéal pour le très haut volume ou les tâches simples.

Typepar 1M tokens
Entrée (prompt)$0.030
Sortie (complétion)$0.120
Lecture cache$0.0060

Capacités

Taille du contexte524K
Tokens de sortie max131K
TokenizerOther
Entréetext
Sortietext
Date de sortie10 août 2026

Benchmarks

Intelligence générale
MMLU
Non reporté
MMLU-Pro
86.3%
GPQA Diamond
89%
Mathématiques
MATH-500
Non reporté
AIME 2026
95.3%
Programmation
HumanEval
Non reporté
SWE-bench Verified
70.6%
LiveCodeBench
87.8%
Agentique
Terminal-Bench 2.1
57%

Où se situe Solar Pro 4 ?

Comparez son indice de performance à tous les autres modèles.

Voir le classement performance

Usages recommandés

ProgrammationAnalyseTraductionChat général

Points forts

  • Contexte de 512K tokens avec jusqu'à 128K en sortie sur une seule réponse
  • Tool calling pris en charge sur l'API, pour des boucles agentiques long-horizon plutôt que des réponses en un seul tour
  • Mathématiques de compétition, génération de code et raisonnement général font tous partie de la suite reportée, le périmètre ne se limite donc pas au code
  • Anglais, coréen et japonais pris en charge, avec une spécialisation coréenne et japonaise documentée couvrant des suites de domaine médical et juridique

Limites

  • L'exécution agentique, précisément ce que le modèle revendique, reste son axe le plus faible à côté de ses propres résultats de raisonnement
  • La plupart des lignes de benchmark publiées sont auto-évaluées en interne plutôt que mesurées par un tiers. S'y ajoutent des limites de périmètre dures : texte seul, trois langues, poids fermés

Questions fréquentes

Ressources

Ce modèle peut utiliser vos données pour l'entraînement

Modèles similaires