{"version":"1.0","type":"rich","provider_name":"Acast","provider_url":"https://acast.com","height":250,"width":700,"html":"<iframe src=\"https://embed.acast.com/$/660681b953b2df00165f1c32/6abd42d8205819f3d7d75523?\" frameBorder=\"0\" width=\"700\" height=\"250\"></iframe>","title":"Pourquoi les IA ont besoin de \"token\" ?  ","thumbnail_width":200,"thumbnail_height":200,"thumbnail_url":"https://open-images.acast.com/shows/660681b953b2df00165f1c32/1790788193027-779f723c-5e81-4ce6-8ed7-80cd739c61ea.jpeg?height=200","description":"<p>ChatGPT ne lit pas réellement votre phrase mot par mot. Avant de répondre, il la découpe en petites unités appelées « tokens », et cette mécanique détermine à la fois ce qu’une IA peut lire, combien elle coûte et jusqu’où elle peut suivre une conversation.</p><p><br></p><p>Un token peut correspondre à un mot entier, mais aussi à une partie de mot, quelques caractères ou un signe de ponctuation. Le découpage dépend du tokenizer, le logiciel utilisé par chaque famille de modèles. Une même phrase peut donc nécessiter un nombre différent de tokens selon l’IA et la langue employée. Chez OpenAI, l’ordre de grandeur souvent donné pour l’anglais est d’environ quatre caractères par token, soit trois quarts d’un mot. Une fois le texte découpé, le modèle manipule ces unités pour calculer, à partir du contexte, quel token a le plus de chances de suivre les précédents. Il en génère un, puis recommence jusqu’à constituer sa réponse. Un token n’est donc ni une pensée ni une idée : c’est une unité informatique permettant au modèle de représenter et de produire du contenu.</p><p><br></p><p>Ces unités servent également à mesurer sa capacité de travail. Une fenêtre de contexte de 200 000 tokens signifie qu’un modèle peut traiter une certaine quantité d’informations simultanément : votre demande, les instructions, l’historique de la discussion ou des documents. Ce n’est pas pour autant une mémoire permanente. Lorsque cette fenêtre se remplit, certaines informations doivent être condensées ou retirées. Les tokens sont aussi devenus l’unité économique de l’IA. Dans les API utilisées par les entreprises, les fournisseurs facturent généralement séparément les tokens envoyés au modèle et ceux qu’il génère. Certains distinguent aussi les données déjà mises en cache et les tokens utilisés par les modèles pour raisonner avant d’afficher leur réponse.</p><p><br></p><p>Et le principe dépasse désormais le texte : images, audio et vidéo peuvent eux aussi être convertis en unités comptabilisées par les modèles multimodaux.</p><p>Le token paraît donc minuscule, mais il constitue l’un des compteurs fondamentaux de l’intelligence artificielle : il mesure à la fois ce qu’elle reçoit, ce qu’elle peut garder sous les yeux et une partie du calcul nécessaire pour nous répondre.</p><p><br></p><p>Source : <a href=\"https://www.clubic.com/dossier-630997-un-token-qu-est-ce-que-c-est-et-pourquoi-les-ia-en-ont-elles-besoin.html\" rel=\"noopener noreferrer\" target=\"_blank\">Clubic </a></p>","author_name":"Choses à Savoir"}