Inference-Maxxing à l'ACL 2026 : une plongée en profondeur dans les stratégies de décodage post-SoftMax

La 64e réunion annuelle de l'Association for Computational Linguistics s'est déroulée sous le ciel immaculé de San Diego, en Californie, mais l'atmosphère à l'intérieur des salles de congrès était incroyablement tendue1. Le drame universitaire a atteint des niveaux sans précédent lorsque les organisateurs de la conférence ont rejeté plus d'une centaine d'articles acceptés lors des contrôles de cohérence des versions finales2.

La raison de ce rejet massif était la découverte de références hallucinées disséminées dans les bibliographies2. Les chercheurs ont apparemment utilisé des modèles de langage génératifs pour les aider dans leurs examens de la littérature et ont copié-collé aveuglément les résultats sans vérifier l'existence des citations. Il s'agit d'une défaillance importante du contrôle de la qualité. L'ironie du fait que des experts en traitement du langage naturel ne parviennent pas à contrôler les résultats de leurs propres modèles génératifs est remarquable. Des systèmes automatisés ont signalé les anomalies, et des présidents humains ont confirmé les fausses citations, ce qui a conduit à un retrait nécessaire mais préjudiciable des actes pour protéger l'intégrité du dossier scientifique2.

Les modèles de langage hallucinent lorsque leurs trajectoires de génération s'égarent dans le bruit de faible probabilité de la distribution du vocabulaire. Le contrôle de ce processus de génération autorégressif est le facteur le plus important dans le déploiement d'une intelligence artificielle fiable. Pour les équipes d'ingénieurs qui analysent ces tendances, en particulier celles qui conçoivent des infrastructures souveraines comme BUZZ CHP, les stratégies de décodage représentent la frontière ultime de l'efficacité et de la fiabilité.

BUZZ Calcul haute performance exploite d'énormes grappes de GPU NVIDIA à travers le Canada et les pays nordiques, fournissant un calcul ultra-rapide et des réseaux à faible latence pour les charges de travail intensives3. Maximiser l'utilité de chaque cycle de calcul sur ces grappes nécessite une compréhension approfondie de la façon dont le texte est réellement généré au niveau mathématique.

Les actes de l'ACL 2026 indiquent clairement que l'époque traditionnelle de la troncature de l'espace de probabilité est officiellement révolue5. L'industrie migre rapidement vers la dynamique de l'espace Logit et les algorithmes tenant compte de l'entropie. J'ai passé les dernières semaines à analyser ces articles pour comprendre exactement comment nous pouvons mettre en œuvre ces percées pour donner à nos clients un « avantage injuste ».

La malédiction du goulot d'étranglement SoftMax

Il faut d'abord examiner en profondeur l'architecture standard de la génération de texte. Les modèles de langage autorégressifs reçoivent une requête, traitent le contexte à travers des dizaines de blocs de transformateurs et projettent finalement une matrice d'état cachée dans un vecteur massif de scores bruts appelés Logits. La longueur de ce vecteur Logit correspond parfaitement à la taille du vocabulaire du modèle. Une architecture moderne pourrait générer 128 000 Logits distincts pour chaque étape de prédiction de jeton.

L'approche traditionnelle applique une fonction SoftMax pour convertir ces Logits bruts et sans contrainte en une distribution de probabilité ordonnée 6. La fonction SoftMax exponentie mathématiquement chaque Logit pour s'assurer que toutes les valeurs sont positives, puis divise chaque valeur exponentiée par la somme de tous les Logits exponentiés dans l'ensemble du vecteur6. Cette opération mathématique garantit que la somme des probabilités résultantes est exactement égale à un. La formule est d'une simplicité remarquable, mais elle comporte des dangers cachés pour la stabilité de l'inférence :

La mise à l'échelle de la température modifie fondamentalement ce processus. Avant d'appliquer la fonction SoftMax, le système divise les Logits bruts par un paramètre de température scalaire7. Une valeur de température inférieure à 1,0 accentue la distribution en exagérant les différences entre les Logits élevés et les Logits faibles. Une valeur de température supérieure à 1,0 aplatit la distribution en rapprochant tous les Logits6. Des températures élevées sont absolument nécessaires pour encourager la créativité en augmentant la probabilité de jetons moins probables, ce qui est nécessaire pour la rédaction créative, le remue-méninges et l'exploration agentique complexe.

Une fois les probabilités calculées, le système doit sélectionner un jeton. Le décodage gourmand choisit simplement le jeton le plus probable à chaque fois. Cette approche déterministe est incroyablement ennuyeuse et conduit fréquemment à des boucles dégénératives et répétitives dans la génération de formes longues10. L'échantillonnage stochastique pur sélectionne un jeton au hasard en se basant entièrement sur les pondérations de probabilité. Cette approche sélectionne souvent des déchets absolus dans la queue extrêmement longue de la distribution, provoquant un effondrement contextuel immédiat.

Les méthodes de troncature ont été inventées pour résoudre ce problème précis. L'échantillonnage Top-K trie les probabilités et ne conserve que les meilleurs jetons K en rejetant tout le reste6. Cette coupure rigide est insensible au contexte et exclut souvent des choix parfaitement valides lorsque le modèle envisage de nombreuses options plausibles. L'échantillonnage par noyau, largement connu sous le nom de Top-P, tente de résoudre ce problème en conservant les jetons jusqu'à ce que leur probabilité cumulative atteigne un seuil strict P6. Cela permet au bassin de candidats de s'adapter à la forme de la distribution. L'échantillonnage Min-P fixe un seuil dynamique en multipliant la probabilité la plus élevée par un facteur de base et en rejetant tout jeton qui tombe en dessous de cette limite nouvellement calculée11.

Ces méthodes traditionnelles souffrent toutes d'un défaut fatal et mathématiquement indéniable. Elles opèrent toutes dans l'espace de probabilité13. Étant donné que l'espace de probabilité est entièrement défini par la fonction SoftMax dépendante de la température, ces méthodes de troncature échouent complètement lorsque la température augmente11. À une température de 2,0, la fonction SoftMax gonfle artificiellement la masse de probabilité du bruit gaussien pur. Top-P et Min-P commencent soudainement à admettre des jetons logiquement incohérents dans le bassin de candidats9. Le texte dégénère rapidement. Le modèle perd l'intrigue et commence à halluciner des articles de recherche inexistants. Le recours à Top-P dans des environnements à haute température est une limitation connue que cet article aborde directement.

Top-N Sigma et la révolution pré-SoftMax

L'article de recherche intitulé « Top-n Sigma : Not All Logits Are You Need » remet fondamentalement en question l'ensemble du paradigme de l'espace de probabilité15. Les auteurs proposent d'opérer directement sur les Logits pré-SoftMax8. Il s'agit d'une démarche contre-intuitive mais bien fondée qui évite les vulnérabilités de l'échantillonnage traditionnel.

L'idée centrale du cadre Top-N Sigma découle de la visualisation de la distribution Logit brute avant que les mathématiques ne soient déformées par les exponentielles. Les Logits se séparent naturellement en deux régions très distinctes8. Il y a une région bruyante à distribution gaussienne et une région informative distincte9. La région bruyante représente la grande majorité de l'espace du vocabulaire. Il s'agit des jetons grammaticalement incorrects et contextuellement non pertinents que le modèle sait intrinsèquement être erronés. La région informative contient la très petite poignée de jetons qui ont réellement un sens pour la prochaine étape de la séquence.

L'application de la fonction SoftMax détruit de force cette séparation statistique claire. SoftMax force une distribution log-normale sur le bruit de fond, brouillant de façon permanente la ligne mathématique entre les bons et les mauvais jetons9. Lorsque vous augmentez la température, cette distribution log-normale gonfle, poussant les jetons littéralement indésirables au-delà des seuils mathématiques utilisés par l'échantillonnage du noyau.

L'algorithme Top-N Sigma filtre élégamment le bruit avant que SoftMax ne touche aux nombres. Le système calcule d'abord le Logit maximal dans le vecteur. Il calcule ensuite l'écart type de tous les Logits dans le vecteur6. Le seuil de coupure est défini strictement comme le Logit maximal moins N fois l'écart type6. Tout Logit tombant en dessous de ce seuil statistique est forcé à l'infini négatif6.

Cette méthode permet d'obtenir une invariance absolue de la température9. La preuve mathématique est incroyablement simple. Étant donné que la mise à l'échelle de la température divise simplement tous les Logits par un scalaire constant, le Logit maximal et l'écart type sont mis à l'échelle selon exactement la même proportion6. Par conséquent, l'ensemble filtré de jetons survivants reste mathématiquement identique quelle que soit la température appliquée6.

Le paramètre de température peut maintenant être utilisé uniquement pour contrôler la distribution de probabilité parmi les candidats hautement valides sans jamais entraîner le bruit gaussien dans le bassin d'échantillonnage9.

Cela réduit considérablement la bande passante de la mémoire requise pour l'étape de génération finale. La communauté de la source ouverte recommande de définir le paramètre N entre 0,3 et 1,5 pour un déploiement optimal17. Des résultats expérimentaux approfondis sur des ensembles de données axés sur le raisonnement démontrent que Top-N Sigma surpasse non seulement les approches d'échantillonnage existantes, mais aussi le décodage gourmand déterministe, tout en maintenant une performance constante à des températures extrêmement élevées10.

Chez BUZZ CHP, nous sommes obsédés par l'idée de tirer le maximum de performance de notre silicium. C'est exactement le type d'optimisation qui nous permet d'offrir des modèles aussi créatifs et de haute qualité à nos entreprises clientes.

Le décodage Top-H et le budget d'entropie

Alors que l'approche Top-N Sigma filtre le bruit global, d'autres chercheurs ont abordé le problème du décodage en budgétisant explicitement l'incertitude. L'article « Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation » propose un cadre mathématique rigoureux pour optimiser le compromis créativité-cohérence11.

Les auteurs notent que les méthodes existantes échouent fondamentalement à mesurer correctement la confiance du modèle. Min-P utilise la probabilité du jeton le plus probable comme indicateur de la confiance globale du modèle7. Il s'agit d'une simplification excessive considérable qui ignore la forme du reste de la distribution. Une distribution avec un jeton fort et une probabilité absolument nulle partout ailleurs est traitée exactement de la même manière qu'une distribution avec un jeton fort et des milliers de jetons alternatifs modérément plausibles7. Min-P est vulnérable à la surtroncature dans les distributions clairsemées et à la sous-troncature dans les distributions denses7. Min-P a une faiblesse documentée ici.

Top-H introduit un problème d'optimisation hautement contraint appelé Divergence minimale contrainte par l'entropie7. L'objectif est de minimiser la divergence mathématique entre la distribution du modèle d'origine et la nouvelle distribution tronquée21. Cependant, cette minimisation est soumise à une contrainte stricte. L'entropie de la nouvelle distribution tronquée ne doit pas dépasser un seuil spécifique. Ce seuil est calculé comme un hyperparamètre alpha multiplié par l'entropie de la distribution complète d'origine11.

Les auteurs fournissent une preuve mathématique formelle démontrant que le problème de Divergence minimale contrainte par l'entropie est entièrement équivalent à la Maximisation de la masse contrainte par l'entropie7. L'objectif passe à la maximisation de la masse de probabilité retenue tout en maintenant l'entropie en dessous de la limite du budget21. L'article prouve ensuite que la résolution de ce problème de maximisation de la masse est NP-difficile7.

Pour rendre ce concept mathématiquement rigoureux pratique pour les moteurs d'inférence en temps réel, les auteurs ont développé un algorithme gourmand efficace sur le plan informatique11. L'algorithme Top-H trie d'abord les jetons par ordre décroissant de probabilité11. Il initialise un ensemble de candidats vide. Il ajoute ensuite de manière itérative des jetons à l'ensemble un par un11. Après chaque ajout, l'algorithme recalcule la distribution de probabilité sur le nouveau sous-ensemble et calcule son entropie mise à jour11. Si la nouvelle entropie dépasse le seuil budgété, l'algorithme rejette immédiatement le jeton le plus récemment ajouté et met fin au processus de sélection11.

Cela crée un environnement d'échantillonnage magnifiquement dynamique et autocorrecteur. Lorsque le modèle est très incertain, la distribution d'origine a une entropie massive. Le budget calculé est donc très important. L'algorithme inclut de nombreux jetons dans le pool final, ce qui encourage fortement la créativité et l'exploration21. Lorsque le modèle est très confiant, la distribution d'origine est nette. Le budget d'entropie est donc petit. L'algorithme limite strictement le bassin de candidats, imposant la cohérence logique et empêchant les hallucinations21.

Les résultats empiriques de cette approche sont solides. Le décodage Top-H surpasse l'échantillonnage Min-P de pointe jusqu'à 25,63 % sur les tests comparatifs d'écriture créative tout en maintenant facilement des capacités de raisonnement robustes sur des ensembles de données logiques difficiles comme GSM8K et GPQA7. En ajustant le paramètre alpha, généralement entre 0,3 et 0,5, les opérateurs peuvent parfaitement ajuster la rigueur de la génération sans rompre la cohérence sous-jacente21. Pour les clients de BUZZ CHP qui créent des assistants d'écriture créative ou des agents de jeu de rôle dynamiques, le décodage Top-H offre une amélioration considérable de la qualité de la sortie sans nécessiter d'affinement des poids du modèle de base.

L'échantillonnage Min-K et la falaise sémantique

La reconnaissance la plus prestigieuse à l'ACL 2026 est allée à la présentation orale très convoitée de l'article « Min-k Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit Dynamics »13. Cet article identifie une faiblesse architecturale critique dans les méthodes globales comme Top-N Sigma et propose une solution efficace.

Top-N Sigma repose fortement sur l'écart type global de l'ensemble du vecteur Logit13. Les statistiques globales sont très vulnérables au bruit de longue traîne13. Si le modèle rencontre une invite bizarre qui injecte une variance massive dans les profondeurs les plus profondes de la queue du vocabulaire, la métrique de l'écart type se déforme considérablement. Cela déforme le seuil de troncature pour toute l'étape de génération, ce qui peut couper des jetons valides ou laisser entrer du bruit dangereux13. Le recours à l'écart type global lorsque la longue queue se comporte de manière sauvage est une recette pour le désastre dans les environnements de production.

L'échantillonnage Min-K résout cette vulnérabilité en analysant la forme hyperlocale de la distribution Logit triée. L'algorithme recherche activement un phénomène mathématique appelé falaise sémantique13. Une falaise sémantique est la position exacte dans la distribution où les jetons de base à haute confiance passent brusquement et violemment à des jetons incertains de longue traîne13.

L'algorithme trie d'abord les Logits par ordre décroissant13. Il calcule la plage dynamique de l'ensemble du vecteur, définie strictement comme le Logit maximal moins le Logit minimal13. Il calcule ensuite un taux de décroissance relatif pondéré en fonction de la position pour chaque paire adjacente de jetons dans la liste triée13.

La formule de décroissance calcule la différence mathématique entre le Logit actuel et le Logit suivant dans la séquence. Elle divise cette différence exacte par la plage dynamique pour normaliser correctement la valeur par rapport à toute transformation linéaire13. Enfin, elle multiplie le résultat normalisé par un facteur de pondération spécifique de un divisé par la position actuelle de l'indice13.

Ce facteur de pondération de position inverse est la recette secrète absolue de l'algorithme. Il force fortement le système de détection à prioriser les baisses de probabilité considérables près du sommet de la distribution13. L'algorithme analyse tous ces taux de décroissance calculés et identifie la valeur maximale absolue. La position d'index de cette valeur maximale représente parfaitement la falaise sémantique13. L'algorithme définit la taille du candidat à cette falaise et tronque de manière agressive absolument tout ce qui vient après13.

Comme cette méthode repose entièrement sur des différences relatives normalisées par la plage dynamique globale, elle permet d'obtenir une invariance de la température stricte et démontrable13. La forme relative de la falaise ne change pas lorsque les Logits sont mis à l'échelle. De plus, les évaluations empiriques démontrent une sensibilité extrêmement faible aux choix d'hyperparamètres, ce qui en fait un rêve pour les environnements de production13.

Les méthodes standard basées sur la probabilité s'effondrent complètement dans des conditions de température extrêmes, alors que Min-K améliore constamment la qualité du texte et maintient une robustesse logique absolue13.

La reconnaissance de la présentation orale était bien méritée.

Pour nos équipes d'ingénieurs de BUZZ CHP, Min-K représente le Saint Graal de la stabilité. Lorsque les entreprises clientes déploient des points de terminaison personnalisés sur nos serveurs bare metal, elles exigent une prévisibilité absolue. Min-K nous permet de garantir que les résultats de leurs modèles resteront mathématiquement limités aux jetons de confiance les plus élevés, quelle que soit la façon dont ils ajustent le curseur de température sur leur tableau de bord.

Infrastructure-Maxxing chez BUZZ CHP

Comprendre ces stratégies d'échantillonnage mathématique incroyablement denses est purement académique, à moins qu'elles ne soient directement mappées sur du matériel physique. Pour BUZZ CHP, le néonuage souverain à la croissance la plus rapide au Canada, l'intersection des algorithmes de décodage avancés et de l'infrastructure physique est exactement l'endroit où la véritable domination du marché est établie24.

L'intelligence artificielle souveraine exige que toutes les données d'entraînement, les poids du modèle et les journaux de génération restent fermement à l'intérieur des frontières nationales4. Cela protège les infrastructures nationales critiques, les données exclusives des entreprises et la recherche gouvernementale sensible contre les risques géopolitiques et l'excès de réglementation étrangère4. BUZZ Calcul haute performance garantit cette souveraineté en exploitant d'énormes grappes dans des centres de données de niveau 3 situés strictement au Canada et dans les pays nordiques3.

Ces installations abritent des milliers de GPU NVIDIA parmi les meilleurs de leur catégorie, y compris les systèmes HGX H100, HGX H200, HGX B200 et l'énorme GB200 NVL723. Ces nœuds de calcul sont fortement interconnectés avec les réseaux NVIDIA Quantum InfiniBand et NVLink pour garantir des performances d'entraînement et d'inférence de pointe3.

Cependant, la puissance brute de calcul est facilement gaspillée par des pipelines logiciels inefficaces. Lors du déploiement de grands modèles de langage avancés avec des stratégies de décodage complexes comme Top-H ou Min-K, la couche de calcul nécessite un accès instantané à des poids de modèle massifs et des mises à jour d'état continues. Les charges de travail d'inférence standard sont fortement liées à la mémoire. Le système passe plus de temps à déplacer les données de la mémoire vers les cœurs de traitement qu'à effectuer réellement des calculs utiles.

C'est exactement là que l'intégration de BUZZ CHP avec VAST Data change complètement la donne25. BUZZ CHP utilise l'architecture DASE (Disaggregated, Shared-Everything) de VAST Data, communément appelée DASE25. Cette architecture élimine les goulots d'étranglement classiques des systèmes de stockage traditionnels en séparant physiquement les nœuds de calcul du support de stockage tout en conservant un espace de noms global hautement unifié26.

Lorsqu'un point de terminaison d'inférence utilisant l'algorithme Top-N Sigma s'exécute sur un cluster CHP, le système d'exploitation VAST AI fournit l'énorme évolutivité multi-locataire et l'isolation des performances nécessaires pour prendre en charge la charge de travail sans interférence de voisin bruyant25. L'architecture DASE alimente les GPU NVIDIA en données d'entraînement et en artefacts de modèles à des vitesses sans précédent25.

Étant donné que Top-N Sigma réduit considérablement les calculs SoftMax requis en filtrant le vecteur Logit à un stade précoce, la bande passante de la mémoire libérée sur le GPU peut être pleinement utilisée pour traiter des tailles de lots plus grandes. Cela crée un gain d'efficacité cumulatif. Un stockage incroyablement rapide alimente des GPU incroyablement rapides qui exécutent des algorithmes de décodage hautement optimisés.

De plus, le VAST AgentEngine prend en charge les agents autonomes et les charges de travail basées sur le raisonnement de manière native au sein de l'infrastructure25. L'avenir de l'intelligence artificielle est indéniablement agentique. Les agents autonomes ne répondent pas seulement à des requêtes uniques. Ils raisonnent sur des données en temps réel, utilisent des outils externes et orchestrent en permanence des flux de travail incroyablement complexes et en plusieurs étapes à l'échelle mondiale26.

L'informatique agentique exige une fiabilité absolue et constante dans la génération de texte. Un seul jeton hallucinatoire causé par un mauvais tirage d'échantillonnage Top-P à haute température peut complètement faire dérailler tout un processus de raisonnement en chaîne de pensée, amenant l'agent à exécuter un appel d'outil catastrophique. En intégrant des méthodes d'échantillonnage invariantes en température et limitées par l'entropie, telles que Min-K et Top-H, dans les pipelines d'inférence de base, les clients qui utilisent le nuage sécurisé de BUZZ CHP peuvent déployer des agents autonomes qui restent parfaitement cohérents, même lorsqu'ils sont chargés de résoudre des problèmes hautement créatifs à haute température13.

BUZZ CHP aligne ce calcul haute performance extrême avec une durabilité environnementale sans compromis. Chaque grappe de GPU déployée dans le nuage souverain est alimentée exclusivement par des énergies renouvelables3. Les centres de données intégrés verticalement sont dotés d'une ingénierie d'efficacité énergétique ultra-faible et d'une planification d'infrastructure soucieuse du carbone3. Grâce à l'initiative Green GPU, les organisations peuvent faire croître de manière agressive leurs usines d'intelligence artificielle sans détruire leurs objectifs de durabilité d'entreprise3. Le partenariat récent avec Bell Canada étend davantage cette capacité de calcul souveraine et durable à l'échelle nationale4.

Vous pouvez absolument avoir le beurre et l'argent du beurre en ce qui concerne la densité de calcul extrême et la gestion environnementale.

L'avenir du décodage et de l'échelle d'inférence

Les actes de l'ACL 2026 devraient servir de signal d'alarme à l'ensemble de la communauté de l'apprentissage automatique. L'époque où l'on se fiait aveuglément au Top-P et au Min-P pour la génération est officiellement révolue. La troncature de l'espace de probabilité est un concept fondamentalement défectueux qui s'effondre dès qu'un modèle doit augmenter sa température pour l'exploration créative. Tout ingénieur qui s'appuie encore sur ces méthodes traditionnelles dans un environnement de production nuit activement aux performances de son application.

L'introduction de la dynamique de l'espace Logit représente un changement dans la façon dont l'industrie gère le bruit statistique inhérent aux grands espaces de vocabulaire. Top-N Sigma prouve que le traitement des Logits bruts comme une distribution gaussienne permet une élimination du bruit incroyablement efficace avant le goulot d'étranglement SoftMax, qui est coûteux en termes de calcul9. Il s'agit d'une victoire considérable pour les systèmes matériels limités par la mémoire. Le décodage Top-H prouve que l'application de budgets d'entropie stricts à l'étape de génération permet d'améliorer considérablement l'équilibre entre la cohérence logique et la créativité requise7. Enfin, le cadre d'échantillonnage Min-K, lauréat du prix Oral, prouve que l'analyse des taux de décroissance relatifs locaux pour trouver des falaises sémantiques immunise complètement le processus de génération contre les anomalies statistiques à longue traîne13.

Pour les ingénieurs, les scientifiques et les chercheurs hyperbrillants qui déploient ces modèles, l'adoption de ces stratégies de décodage post-SoftMax est une exigence stricte pour rester compétitifs dans un paysage qui exige à la fois un raisonnement sans faille et une créativité sans limites.

Le déploiement de ces algorithmes avancés sur une infrastructure spécialement conçue et prête pour les agents, comme le nuage souverain de BUZZ CHP, garantit que chaque jeton généré est mathématiquement optimisé à la fois pour la vitesse et la précision. Notre intégration native avec VAST Data et notre engagement à fournir le tout dernier matériel NVIDIA signifient que nos clients peuvent passer moins de temps à se creuser la tête sur les goulots d'étranglement de la mémoire et plus de temps à créer des outils d'intelligence artificielle de classe mondiale.

Nous sommes incroyablement enthousiastes à l'idée d'intégrer ces nouvelles stratégies de décodage dans nos points de terminaison d'inférence gérés. La recherche présentée à l'ACL 2026 décrit clairement la feuille de route pour la prochaine génération d'IA générative. L'optimisation de l'inférence est la nouvelle norme, et les outils pour y parvenir sont enfin là. Si vous concevez des systèmes d'IA souverains, fiables et performants, il n'y a jamais eu de meilleur moment pour être développeur. N'hésitez pas à contacter l'équipe de BUZZ CHP pour commencer.

Works cited

1.     ACL 2026: The 64th Annual Meeting of the Association for Computational Linguistics, https://2026.aclweb.org/

2.     ACL Statement on Desk Rejecting Papers with Hallucinated References, https://2026.aclweb.org/acl_statement/

3.     BUZZ HPC : BUZZ High Performance Computing, https://www.buzzhpc.ai/

4.     HIVE Digital Technologies Ltd.: Exhibit 99.2 - Filed by newsfilecorp.com - SEC.gov, https://www.sec.gov/Archives/edgar/data/1720424/000106299325015716/exhibit99-2.htm

5.     ACL 2026 Accepted Papers: NLP Trends, LLM Agents & Top Highlights, https://www.bohrium.com/en/blog/acl-2026-accepted-papers-highlights/

6.     LLM Sampling: Temperature, Top-K, Top-P, and Min-P Explained - Let's Data Science, https://letsdatascience.com/blog/llm-sampling-temperature-top-k-top-p-and-min-p-explained

7.     Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation - NIPS, https://papers.neurips.cc/paper_files/paper/2025/file/294de0fa7149adcb88aa3119c239c63e-Paper-Conference.pdf

8.     arXiv:2411.07641v1 [cs.LG] 12 Nov 2024, https://arxiv.org/pdf/2411.07641?

9.     Top-nσ: Eliminating Noise in Logit Space for Robust Token Sampling of LLM - ACL Anthology, https://aclanthology.org/2025.acl-long.528.pdf

10.  Top-n⁢𝜎: Not All Logits Are You Need - arXiv, https://arxiv.org/html/2411.07641v1

11.  Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation - arXiv, https://arxiv.org/html/2509.02510v1

12.  Min P Sampling: Balancing Creativity and Coherence at High Temperature - ResearchGate, https://www.researchgate.net/publication/381882972_Min_P_Sampling_Balancing_Creativity_and_Coherence_at_High_Temperature

13.  Min-k Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit Dynamics - arXiv, https://arxiv.org/html/2604.11012v1

14.  Top-n𝜎: Eliminating Noise in Logit Space for Robust Token Sampling of LLM | Request PDF, https://www.researchgate.net/publication/394303350_Top-n_Eliminating_Noise_in_Logit_Space_for_Robust_Token_Sampling_of_LLM

15.  [2411.07641] Top-$nσ$: Not All Logits Are You Need - arXiv, https://arxiv.org/abs/2411.07641

16.  Top- n σ nsigma : Not All Logits Are You Need - ResearchGate, https://www.researchgate.net/publication/385749971_Top-nsigma_Not_All_Logits_Are_You_Need

17.  The official code repo and data hub of top_nsigma sampling strategy for LLMs. - GitHub, https://github.com/Tomorrowdawn/top_nsigma

18.  [RFC] Add Top-nσ logit truncation example via custom logits processor #45023 - GitHub, https://github.com/vllm-project/vllm/issues/45023

19.  [2509.02510] Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation - arXiv, https://arxiv.org/abs/2509.02510

20.  Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation | Request PDF - ResearchGate, https://www.researchgate.net/publication/395212209_Top-H_Decoding_Adapting_the_Creativity_and_Coherence_with_Bounded_Entropy_in_Text_Generation

21.  Official PyTorch implementation of Top-H decoding—an entropy-aware, training-free sampler that adapts creativity and coherence in LLM text generation. Paper: arXiv:2509.02510 - GitHub, https://github.com/ErfanBaghaei/Top-H-Decoding

22.  acl2026 · GitHub Topics, https://github.com/topics/acl2026

23.  Min-k Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit Dynamics - ACL Anthology, https://aclanthology.org/2026.acl-long.681/

24.  Architecting Modern AI Systems: Platforms, Agents, and Integration - Video, https://home.mlops.community/public/videos/architecting-modern-ai-systems-platforms-agents-and-integration

25.  VAST Data Boosts BUZZ HPC's Sovereign AI Cloud - TechIntelPro, https://techintelpro.com/news/ai/generative-ai/vast-data-boosts-buzz-hpcs-sovereign-ai-cloud

26.  BUZZ HPC Selects VAST Data to Power Sovereign AI, https://www.vastdata.com/press-releases/buzzhpc-selects-vast-data-unlock-future-agentic-computing