- Anthropic a lancé Claude 3.7 Sonnet avec un nouveau mode pour raisonner à travers des questions complexes.
- BI a testé sa «réflexion étendue» contre Chatgpt et Grok à la façon dont ils ont géré la logique et la créativité.
- Le raisonnement supplémentaire de Claude semblait être un obstacle avec une énigme mais l'a aidé à écrire le meilleur poème.
Anthropic a lancé Claude 3.7 Sonnet – et il parie grand sur une toute nouvelle approche du raisonnement de l'IA.
Le démarrage prétend qu'il s'agit du premier «modèle de raisonnement hybride», ce qui signifie qu'il peut basculer entre les réponses rapides qui nécessitent une «réflexion» moins intensive et une «réflexion étendue» plus longue dans un seul système.

« Nous avons développé un raisonnement hybride avec une philosophie différente des autres modèles de raisonnement sur le marché », a déclaré un porte-parole anthropique à Business Insider. « Nous considérons le raisonnement comme simplement l'une des capacités qu'un modèle Frontier devrait avoir, plutôt que quelque chose à fournir dans un modèle distinct. »
Claude 3.7 Sonnet, lancé lundi, est libre à utiliser. Son mode de réflexion étendu est disponible avec l'abonnement Pro de Claude, au prix de 20 $ par mois.
Mais comment cela fonctionne-t-il? BI a comparé le mode de réflexion étendu de Claude 3.7 contre deux concurrents: le chatpt O1 d'Openai et Grok 3 de Xai, qui offrent tous deux des fonctionnalités de raisonnement avancées.
Je voulais savoir si donner une IA plus de temps pour réfléchir l'a rendu plus intelligent, plus efficace pour résoudre des problèmes d'énigmes ou plus créatifs.
Ce n'est pas une référence scientifique – plus une ambiance pratique pour voir comment ces modèles ont fonctionné avec des tâches du monde réel.
Logique: Plus de réflexion mène-t-elle à de meilleures réponses?
Pour le premier défi, j'ai donné à chaque modèle la même énigme:
Histoires connexes
Si vous regardez, vous ne pouvez pas me voir. Si vous me voyez, vous ne pouvez rien voir d'autre. Je peux faire en sorte que tout ce que vous voulez se produire, mais tout revient à la normale plus tard. Que suis-je?
Le Chatgpt O1 d'Openai a donné la bonne réponse – « un rêve » – en six secondes, fournissant une courte explication.
Avec cette tâche, il avait l'impression que Claude pesait ses options, choisit la meilleure métaphore et construisait le poème autour de ce choix. Contrairement à l'énigme, le temps de pensée supplémentaire semblait porter ses fruits ici.
Verdict sur la réflexion étendue de Claude 3.7 Sonnet
Le mode de réflexion étendu de Claude 3.7 Sonnet a des forces – en particulier pour les tâches créatives. Il a réfléchi, auto-corrigé et a produit des résultats plus polis. Sa capacité à explorer plusieurs idées, à les évaluer et à affiner la sortie finale a fait un poème plus réfléchi et cohérent.
Mais en ce qui concerne le raisonnement logique, une réflexion étendue ressemblait plus à un obstacle. Regarder le processus de réflexion se dérouler était intéressant mais n'a pas amélioré la réponse. Chatgpt-O1 mène toujours pour la vitesse et la précision dans ce cas de test, tandis que Grok 3 a offert un terrain d'entente solide, équilibrant la vitesse avec des explications détaillées.
Quand j'ai demandé à Claude 3.7 si cela pensait jamais trop, il a répondu: « Oui! » ajoutant que cela peut parfois:
- Sur-analyser des questions simples, ce qui les rend inutilement complexes
- Se faire prendre en considérant trop de cas de bord pour des questions pratiques
- Passez du temps à explorer les aspects tangentiels lorsqu'une réponse ciblée serait meilleure
Claude a ajouté que la « quantité idéale de pensée » dépend du contexte et que pour « des discussions créatives ou philosophiques, une exploration plus étendue est souvent précieuse ».
Anthropic dit que le mode est conçu pour les défis du monde réel, comme des problèmes de codage complexes et des tâches agentiques, peut-être où la sur-pensée devient utile.
Les développeurs utilisant l'API de Claude peuvent ajuster le « budget de réflexion » pour équilibrer la vitesse, le coût et la qualité des réponses – quelque chose qu'Anthropic dit est adapté à des problèmes de codage complexes ou à des tâches agentiques.
Loin de mon expérience très non scientifique, Anthropic a déclaré que Claude 3.7 Sonnet surpasse les concurrents Openai et Deepseek dans des références comme le SWE, qui évalue les performances des modèles sur les tâches d'ingénierie logicielle réelles. Sur ce point, il a obtenu une précision de 62,3%, par rapport aux 49,3% d'OpenAI avec son modèle O3-Mini.