Maximización de la inferencia en ACL 2026: un análisis en profundidad de las estrategias de decodificación postsoftmax

La 64.ª Reunión Anual de la Asociación de Lingüística Computacional se celebró bajo el cielo despejado de San Diego, California, pero el ambiente dentro de los recintos de la convención estaba que ardía1. El drama académico alcanzó niveles sin precedentes cuando los organizadores de la conferencia rechazaron más de cien artículos aceptados durante las comprobaciones finales de coherencia de los documentos listos para imprimir2

El motivo de este rechazo masivo fue que se descubrieron referencias inventadas repartidas por todas las bibliografías2. Al parecer, los investigadores utilizaron modelos de lenguaje generativos para ayudar en sus revisiones bibliográficas y copiaron y pegaron a ciegas los resultados sin comprobar si las citas existían de verdad. Se trata de un fallo grave en el control de calidad. No deja de ser irónico que los expertos en procesamiento del lenguaje natural no hayan podido controlar los resultados de sus propios modelos generativos. Los sistemas automatizados detectaron las anomalías y los coordinadores confirmaron las citas falsas, lo que llevó a una eliminación necesaria, aunque perjudicial, de las actas para proteger la integridad del registro científico2.

Los modelos de lenguaje alucinan cuando sus trayectorias de generación se adentran en el ruido de baja probabilidad de la distribución del vocabulario. Controlar este proceso de generación autorregresiva es el factor más importante para implementar una inteligencia artificial fiable. Para los equipos de ingeniería que analizan estas tendencias, sobre todo los que diseñan infraestructuras soberanas como BUZZ HPC, las estrategias de decodificación representan la última frontera de la eficiencia y la fiabilidad.

BUZZ HPC gestiona enormes clústeres de GPU de NVIDIA en Canadá y los países nórdicos, proporcionando computación ultrarrápida y redes de baja latencia para cargas de trabajo intensivas3. Maximizar la utilidad de cada ciclo de computación en estos clústeres requiere una comprensión profunda de cómo se genera realmente el texto a nivel matemático.

Las actas de la ACL 2026 indican claramente que la era heredada del truncamiento del espacio de probabilidad ha llegado oficialmente a su fin5. El sector está migrando rápidamente hacia la dinámica del espacio logit y los algoritmos sensibles a la entropía. He pasado las últimas semanas analizando estos artículos para entender exactamente cómo podemos implementar estos avances y ofrecer a nuestros clientes una «ventaja desleal».

La maldición del cuello de botella de softmax

Primero hay que examinar en profundidad la arquitectura estándar de la generación de texto. Los modelos de lenguaje autorregresivos reciben una indicación, procesan el contexto a través de docenas de bloques de transformadores y, finalmente, proyectan una matriz de estado oculto en un vector enorme de puntuaciones en bruto llamadas logits. La longitud de este vector de logits coincide perfectamente con el tamaño del vocabulario del modelo. Una arquitectura moderna podría generar 128 000 logits distintos para cada paso de predicción de un token.

El enfoque tradicional aplica una función softmax para convertir estos logits en bruto y sin restricciones en una distribución de probabilidad ordenada6. La función softmax eleva matemáticamente a la potencia cada logit para garantizar que todos los valores sean positivos y luego divide cada valor elevado a la potencia por la suma de todos los logits elevados a la potencia en todo el vector6. Esta operación matemática garantiza que las probabilidades resultantes sumen exactamente uno. La fórmula es maravillosamente sencilla, pero entraña peligros ocultos para la estabilidad de la inferencia:

El escalado de temperatura altera de forma fundamental este proceso. Antes de aplicar la función softmax, el sistema divide los logits en bruto por un parámetro de temperatura escalar7. Un valor de temperatura inferior a 1,0 agudiza la distribución al exagerar las diferencias entre los logits altos y bajos. Un valor de temperatura superior a 1,0 aplana la distribución al acercar todos los logits6. Las temperaturas altas son absolutamente necesarias para fomentar la creatividad al elevar la probabilidad de los tókenes menos probables, lo cual es necesario para la escritura creativa, la lluvia de ideas y la exploración compleja de los agentes.

Una vez calculadas las probabilidades, el sistema debe seleccionar un token. La decodificación codiciosa simplemente elige el token de mayor probabilidad en cada ocasión. Este enfoque determinista es increíblemente aburrido y con frecuencia conduce a bucles degenerativos y repetitivos en la generación de formato largo10. El muestreo estocástico puro selecciona un token al azar basándose por completo en las ponderaciones de probabilidad. Este enfoque a menudo selecciona auténtica basura de la cola extremadamente larga de la distribución, lo que provoca un colapso contextual inmediato.

Los métodos de truncamiento se inventaron para resolver precisamente este problema. El muestreo Top-K ordena las probabilidades y solo conserva los K tokens principales, descartando todo lo demás6. Este corte tan rígido no tiene en cuenta el contexto y, a menudo, excluye opciones perfectamente válidas cuando el modelo está barajando muchas alternativas plausibles. El muestreo de núcleo, más conocido como Top-P, intenta solucionar esto conservando los tokens hasta que su probabilidad acumulada alcance un umbral estricto6. Esto permite que el grupo de candidatos se adapte a la forma de la distribución. El muestreo Min-P establece un umbral dinámico multiplicando la probabilidad más alta por un factor base y descartando cualquier token que esté por debajo de este límite recién calculado11.

Todos estos métodos tradicionales adolecen de un fallo fatal y matemáticamente innegable. Todos operan en el espacio de probabilidad13. Como el espacio de probabilidad viene definido por completo por la función softmax, que depende de la temperatura, estos métodos de truncamiento fallan por completo cuando la temperatura sube11. A una temperatura de 2,0, la función softmax infla artificialmente la masa de probabilidad del ruido gaussiano puro. Top-P y Min-P comienzan de repente a admitir tokens lógicamente incoherentes en el conjunto de candidatos9. El texto se degrada rápidamente. El modelo pierde el hilo y empieza a alucinar con artículos de investigación que no existen. Depender de Top-P en entornos de alta temperatura es una limitación conocida que este artículo aborda directamente.

Top-N Sigma y la revolución presoftmax

El trabajo de investigación titulado «Top-N Sigma: Not All Logits Are You Need» (Top-n sigma: no todos los logits son lo que necesitas) cuestiona de raíz todo el paradigma del espacio de probabilidad15. Los autores proponen operar directamente sobre los logits presoftmax8. Se trata de un enfoque que, aunque parezca contradictorio, está bien fundamentado y que evita las vulnerabilidades del muestreo tradicional.

La idea central del marco Top-N Sigma surge al visualizar la distribución logit en bruto antes de que las funciones exponenciales distorsionen los cálculos. Los logits se separan naturalmente en dos regiones muy distintas8. Hay una región ruidosa con distribución gaussiana y una región informativa bien diferenciada9. La región ruidosa representa la gran mayoría del espacio del vocabulario. Estos son los tokens gramaticalmente incorrectos y contextualmente irrelevantes que el modelo sabe de por sí que están mal. La región informativa contiene el pequeño puñado de tokens que realmente tienen sentido para el siguiente paso de la secuencia.

La aplicación de la función softmax destruye a la fuerza esta clara separación estadística. Softmax fuerza una distribución log-normal sobre el ruido de fondo, difuminando permanentemente la línea matemática entre los tokens buenos y los malos9. Cuando se aumenta la temperatura, esta distribución log-normal se hincha, empujando los tokens que son auténtica basura por encima de los umbrales matemáticos que usa el muestreo de núcleo.

El algoritmo Top-N Sigma filtra elegantemente el ruido antes de que softmax llegue siquiera a tocar los números. El sistema calcula primero el logit máximo en el vector. A continuación, calcula la desviación estándar de todos los logits del vector6. El umbral de corte se define estrictamente como el logit máximo menos N veces la desviación estándar6. Cualquier logit que esté por debajo de este umbral estadístico se establece forzosamente en infinito negativo6.

Este método logra una invariancia absoluta respecto a la temperatura9. La demostración matemática es sorprendentemente sencilla. Dado que el escalado de la temperatura simplemente divide todos los logits por un escalar constante, el logit máximo y la desviación estándar se escalan exactamente en la misma proporción6. Por lo tanto, el conjunto filtrado de tokens supervivientes sigue siendo matemáticamente idéntico independientemente de la temperatura que se aplique6.

El parámetro de temperatura ahora se puede usar únicamente para controlar la distribución de probabilidad entre los candidatos altamente válidos sin que el ruido gaussiano entre nunca en el conjunto de muestreo9.

Esto reduce drásticamente el ancho de banda de la memoria necesario para el paso final de generación. La comunidad de código abierto recomienda establecer el parámetro N entre 0,3 y 1,5 para una implementación óptima17. Unos resultados experimentales exhaustivos con conjuntos de datos centrados en el razonamiento demuestran que Top-N Sigma no solo supera a los enfoques de muestreo existentes, sino que también supera a la decodificación determinista codiciosa, al tiempo que mantiene un rendimiento constante a temperaturas extremadamente altas10.

En BUZZ HPC, nos obsesiona sacar hasta la última gota de rendimiento de nuestros chips. Este es exactamente el tipo de optimización que nos permite ofrecer modelos tan creativos y de alta calidad a nuestros clientes empresariales.

La decodificación Top-H y el presupuesto de entropía

Mientras que el enfoque Top-N Sigma filtra el ruido global, otros investigadores abordaron el problema de la decodificación asignando explícitamente un límite a la incertidumbre. El artículo «Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation» (Decodificación Top-H: cómo adaptar la creatividad y la coherencia con una entropía limitada en la generación de texto) ofrece un marco matemático riguroso para optimizar la compensación entre creatividad y coherencia11.

Los autores señalan que los métodos actuales no logran, en esencia, medir correctamente la confianza del modelo. Min-P utiliza la probabilidad del token más probable como indicador de la confianza general del modelo7. Se trata de una simplificación excesiva que ignora la forma del resto de la distribución. Una distribución con un token fuerte y una probabilidad absolutamente nula en el resto se trata exactamente igual que una distribución con un token dominante y miles de tokens alternativos moderadamente plausibles7. Min-P es vulnerable al truncamiento excesivo en distribuciones escasas y al truncamiento insuficiente en distribuciones densas7. Min-P tiene una debilidad documentada en este aspecto.

Top-H introduce un problema de optimización muy restringido llamado divergencia mínima con restricción de entropía7. El objetivo es minimizar la divergencia matemática entre la distribución del modelo original y la nueva distribución truncada21. Sin embargo, esta minimización está sujeta a una restricción estricta: la entropía de la nueva distribución truncada no debe superar un umbral específico. Este umbral se calcula multiplicando el hiperparámetro alfa por la entropía de la distribución completa origina11.

Los autores proporcionan una prueba matemática formal que demuestra que el problema de la divergencia mínima con restricción de entropía es totalmente equivalente a la maximización de masa con restricción de entropía7. El objetivo cambia a maximizar la masa de probabilidad retenida manteniendo la entropía por debajo del límite establecido21. A continuación, el artículo demuestra que resolver este problema de maximización de la masa es NP-difícil7.

Para hacer práctico este concepto matemáticamente riguroso para los motores de inferencia en tiempo real, los autores desarrollaron un algoritmo codicioso eficiente desde el punto de vista computacional11. El algoritmo Top-H, en primer lugar, ordena los tokens en orden descendente según su probabilidad11. Inicializa un conjunto de candidatos vacío. A continuación, va añadiendo tokens al conjunto de uno en uno, de forma iterativa11. Tras cada nueva incorporación, el algoritmo vuelve a calcular la distribución de probabilidad sobre el nuevo subconjunto y calcula su entropía actualizada11. Si la nueva entropía supera el umbral presupuestado, el algoritmo descarta inmediatamente el token añadido más recientemente y finaliza el proceso de selección11.

Esto crea un entorno de muestreo maravillosamente dinámico y que se autocorrige. Cuando el modelo tiene mucha incertidumbre, la distribución original tiene una entropía enorme. Por lo tanto, el presupuesto calculado es muy grande. El algoritmo incluye muchos tokens en el grupo final, lo que fomenta en gran medida la creatividad y la exploración21. Cuando el modelo tiene mucha confianza, la distribución original es muy precisa. El presupuesto de entropía es, en consecuencia, pequeño. El algoritmo limita estrictamente el grupo de candidatos, lo que impone la coherencia lógica y evita las alucinaciones21.

Los resultados empíricos de este enfoque son sólidos. La decodificación Top-H supera al muestreo Min-P de última generación hasta en un 25,63 % en los puntos de referencia de escritura creativa, al tiempo que mantiene fácilmente unas sólidas capacidades de razonamiento en conjuntos de datos lógicos difíciles como GSM8K y GPQA7. Al ajustar el parámetro alfa, normalmente entre 0,3 y 0,5, los operadores pueden ajustar perfectamente la rigurosidad de la generación sin romper la coherencia subyacente21. Para los clientes de BUZZ HPC que desarrollan asistentes de escritura creativa o agentes dinámicos de juego de roles, la decodificación Top-H ofrece una mejora enorme en la calidad de los resultados sin requerir ningún ajuste de los pesos del modelo base.

El muestreo Min-K y el acantilado semántico

El reconocimiento más prestigioso en la ACL 2026 fue para la muy codiciada presentación oral del artículo «Min-k Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit Dynamics» (Muestreo Min-K: desacoplamiento del truncamiento del escalado de temperatura mediante la dinámica logit relativa)13. Este artículo identifica una debilidad arquitectónica crítica en métodos globales como Top-N Sigma y ofrece una solución eficaz.

Top-N Sigma se basa en gran medida en la desviación estándar global de todo el vector de logits13. Las estadísticas globales son muy susceptibles al ruido de cola larga13. Si el modelo se encuentra con una indicación extraña que inyecta una varianza enorme en lo más profundo de la cola del vocabulario, la métrica de la desviación estándar se distorsiona drásticamente. Esto distorsiona el umbral de truncamiento para todo el paso de generación, lo que puede provocar que se descarten tokens válidos o que se cuele ruido peligroso13. Depender de la desviación estándar global cuando la cola larga se comporta de forma descontrolada es una receta para el desastre en los entornos de producción.

El muestreo Min-K resuelve esta vulnerabilidad analizando la forma hiperlocal de la distribución logit ordenada. El algoritmo busca activamente un fenómeno matemático llamado acantilado semántico13. Un acantilado semántico es la posición exacta en la distribución en la que los tokens centrales de alta confianza pasan brusca y violentamente a ser tokens inciertos de cola larga13.

El algoritmo primero ordena los logits en orden descendente13. Calcula el rango dinámico de todo el vector, definido estrictamente como el logit máximo menos el logit mínimo13. A continuación, calcula una tasa de decaimiento relativa ponderada por la posición para cada par adyacente de tokens de la lista ordenada13.

La fórmula de decaimiento calcula la diferencia matemática entre el logit actual y el siguiente logit de la secuencia. Divide esta diferencia exacta por el rango dinámico para normalizar correctamente el valor frente a cualquier transformación lineal13. Por último, multiplica el resultado normalizado por un factor de ponderación específico de uno dividido por la posición actual del índice13.

Este factor de ponderación de posición inversa es el ingrediente secreto absoluto del algoritmo. Obliga en gran medida al sistema de detección a priorizar las caídas masivas de probabilidad cerca de la parte superior de la distribución13. El algoritmo analiza todas estas tasas de decaimiento calculadas e identifica el valor máximo absoluto. La posición del índice de este valor máximo representa perfectamente el acantilado semántico13. El algoritmo establece el tamaño del candidato en este acantilado y trunca de forma agresiva absolutamente todo lo que viene después13.

Dado que este método se basa por completo en diferencias relativas normalizadas por el rango dinámico global, logra una invariancia estricta y demostrable respecto a la temperatura13. La forma relativa del acantilado no cambia cuando se escalan los logits. Además, las evaluaciones empíricas demuestran una sensibilidad extremadamente baja a las elecciones de hiperparámetros, lo que lo convierte en la opción ideal para entornos de producción13.

Los métodos estándar basados en la probabilidad fallan por completo en condiciones de temperatura extremas, mientras que Min-K mejora constantemente la calidad del texto y mantiene una robustez lógica absoluta13.

El reconocimiento de la presentación oral fue bien merecido.

Para nuestros equipos de ingeniería de BUZZ HPC, Min-K representa el santo grial de la estabilidad. Cuando los clientes empresariales implementan puntos finales personalizados en nuestros servidores bare metal, exigen una previsibilidad absoluta. Min-K nos permite garantizar que los resultados de sus modelos permanecerán matemáticamente limitados a los tokens de mayor confianza, independientemente de cómo ajusten el control deslizante de temperatura en su panel de control.

Maximización de la infraestructura en BUZZ HPC

Comprender estas estrategias de muestreo matemático increíblemente densas es puramente académico a menos que se asignen directamente al hardware físico. Para BUZZ HPC, la neonube soberana de más rápido crecimiento de Canadá, la combinación de algoritmos avanzados de decodificación e infraestructura física es precisamente donde se establece el verdadero dominio del mercado24.

La inteligencia artificial soberana requiere que todos los datos de entrenamiento, los pesos del modelo y los registros de generación permanezcan firmemente dentro de las fronteras nacionales4. Esto protege la infraestructura nacional crítica, los datos privados de las empresas y la investigación gubernamental sensible frente a los riesgos geopolíticos y la intromisión regulatoria extranjera4. BUZZ HPC garantiza esta soberanía operando enormes clústeres en centros de datos de nivel 3 ubicados estrictamente en Canadá y los países nórdicos3.

Estas instalaciones albergan miles de GPU de NVIDIA de primera categoría, como las HGX H100, HGX H200, HGX B200 y los enormes sistemas GB200 NVL723. Estos nodos de cálculo están estrechamente interconectados mediante redes NVIDIA Quantum InfiniBand y NVLink para garantizar el máximo rendimiento en entrenamiento e inferencia3.

Sin embargo, la potencia de cálculo bruta se desperdicia fácilmente debido a flujos de trabajo de software ineficientes. Al implementar grandes modelos de lenguaje avanzados con estrategias de decodificación complejas como Top-H o Min-K, la capa de computación requiere acceso instantáneo a pesos masivos del modelo y actualizaciones continuas del estado. Las cargas de trabajo de inferencia estándar dependen en gran medida de la memoria. El sistema dedica más tiempo a mover datos de la memoria a los núcleos de procesamiento que a realizar cálculos matemáticos útiles.

Aquí es exactamente donde la integración de BUZZ HPC con VAST Data cambia por completo las reglas del juego25. BUZZ HPC utiliza la arquitectura «Disaggregated, Shared-Everything» (DASE) de VAST Data25. Esta arquitectura elimina los clásicos cuellos de botella de los sistemas de almacenamiento heredados al separar físicamente los nodos de computación del medio de almacenamiento, al tiempo que mantiene un espacio de nombres global altamente unificado26.

Cuando un punto final de inferencia que utiliza el algoritmo Top-N Sigma se ejecuta en un clúster de BUZZ HPC, el sistema operativo de IA de VAST proporciona la enorme escalabilidad multiusuario y el aislamiento de rendimiento necesarios para soportar la carga de trabajo sin interferencias de vecinos ruidosos25. La arquitectura DASE alimenta las GPU de NVIDIA con datos de entrenamiento y artefactos de los modelos a velocidades sin precedentes25.

Dado que Top-N Sigma reduce drásticamente los cálculos de softmax necesarios al filtrar el vector de logits desde el principio, el ancho de banda de la memoria liberado en la GPU puede utilizarse plenamente para procesar tamaños de lote más grandes. Esto genera una ganancia de eficiencia exponencial. El almacenamiento increíblemente rápido alimenta las GPU increíblemente rápidas que ejecutan algoritmos de decodificación altamente optimizados.

Además, el VAST AgentEngine admite agentes autónomos y cargas de trabajo basadas en el razonamiento de forma nativa dentro de la infraestructura25. El futuro de la inteligencia artificial es innegablemente agentivo. Los agentes autónomos no se limitan a responder a indicaciones puntuales. Razonan sobre los datos en tiempo real, utilizan herramientas externas y coordinan continuamente flujos de trabajo increíblemente complejos de varios pasos a escala global26.

La computación basada en agentes exige una fiabilidad absoluta y constante en la generación de texto. Un solo token alucinatorio causado por un mal muestreo Top-P a alta temperatura puede descarrilar por completo todo un proceso de razonamiento de cadena de pensamiento, haciendo que el agente ejecute una llamada a una herramienta con consecuencias catastróficas. Al integrar métodos de muestreo invariantes a la temperatura y limitados por la entropía, como Min-K y Top-H, en los canales de inferencia principales, los clientes que utilizan la nube segura de BUZZ HPC pueden implementar agentes autónomos que mantienen una coherencia perfecta incluso cuando se les asigna la tarea de resolver problemas altamente creativos y de alta temperatura13.

BUZZ HPC combina esta computación de alto rendimiento extremo con una sostenibilidad medioambiental sin concesiones. Cada clúster de GPU desplegado en la nube soberana está alimentado exclusivamente por energía renovable3. Los centros de datos integrados verticalmente cuentan con una ingeniería de eficacia de uso de energía ultrabaja y una planificación de la infraestructura que tiene en cuenta las emisiones de carbono3. A través de la iniciativa Green GPU, las organizaciones pueden escalar de forma agresiva sus fábricas de inteligencia artificial sin destruir sus objetivos corporativos de sostenibilidad3. La reciente asociación con Bell Canada amplía aún más esta capacidad de computación soberana y sostenible en todo el país4.

Sin duda, se puede tener todo cuando se trata de densidad de computación extrema y gestión medioambiental.

El futuro de la decodificación y la escala de inferencia

Las actas de la ACL 2026 deberían servir como una llamada de atención para toda la comunidad del aprendizaje automático. La era de confiar ciegamente en Top-P y Min-P para la generación ha llegado oficialmente a su fin. El truncamiento del espacio de probabilidad es un concepto fundamentalmente defectuoso que se desmorona en el momento en que un modelo necesita aumentar su temperatura para la exploración creativa. Cualquier ingeniero que siga confiando en estos métodos tradicionales en un entorno de producción está perjudicando activamente el rendimiento de su aplicación.

La introducción de la dinámica del espacio logit representa un cambio en la forma en que el sector gestiona el ruido estadístico inherente a los grandes espacios de vocabulario. Top-N Sigma demuestra que tratar los logits en bruto como una distribución gaussiana permite eliminar el ruido de forma increíblemente eficiente antes del cuello de botella de softmax, que consume muchos recursos computacionales9. Esto supone una gran ventaja para los sistemas de hardware con limitaciones de memoria. La decodificación Top-H demuestra que imponer presupuestos de entropía estrictos en el paso de generación produce mejoras masivas en el equilibrio entre la coherencia lógica y la creatividad necesaria7. Por último, el marco de muestreo Min-K, ganador del concurso oral, demuestra que analizar las tasas de decaimiento relativas locales para encontrar acantilados semánticos protege por completo el proceso de generación frente a anomalías estadísticas de cola larga13.

Para los ingenieros, científicos e investigadores de gigacerebros que implementan estos modelos, adoptar estas estrategias de decodificación postsoftmax es un requisito imprescindible para seguir siendo competitivos en un panorama que exige tanto un razonamiento impecable como una creatividad sin límites.

Implementar estos algoritmos avanzados en una infraestructura diseñada específicamente y preparada para agentes, como la nube soberana BUZZ HPC, garantiza que cada token generado esté matemáticamente optimizado tanto en velocidad como en precisión. Nuestra integración nativa con VAST Data y nuestro compromiso de proporcionar el hardware de NVIDIA más puntero posibilitan que nuestros clientes dediquen menos tiempo a preocuparse por los cuellos de botella de la memoria y más tiempo a crear herramientas de inteligencia artificial de primera categoría.

Es un auténtico placer para nosotros integrar estas nuevas estrategias de decodificación en nuestros puntos finales de inferencia gestionados. La investigación presentada en ACL 2026 traza claramente la hoja de ruta para la próxima generación de IA generativa. Maximizar la inferencia es el nuevo estándar, y las herramientas para lograrlo por fin están aquí. Si estás creando sistemas de IA soberanos, fiables y de alto rendimiento, nunca ha habido un mejor momento para ser desarrollador. No dude en ponerse en contacto con el equipo de BUZZ HPC para empezar.

Works cited

1.     ACL 2026: The 64th Annual Meeting of the Association for Computational Linguistics, https://2026.aclweb.org/

2.     ACL Statement on Desk Rejecting Papers with Hallucinated References, https://2026.aclweb.org/acl_statement/

3.     BUZZ HPC : BUZZ High Performance Computing, https://www.buzzhpc.ai/

4.     HIVE Digital Technologies Ltd.: Exhibit 99.2 - Filed by newsfilecorp.com - SEC.gov, https://www.sec.gov/Archives/edgar/data/1720424/000106299325015716/exhibit99-2.htm

5.     ACL 2026 Accepted Papers: NLP Trends, LLM Agents & Top Highlights, https://www.bohrium.com/en/blog/acl-2026-accepted-papers-highlights/

6.     LLM Sampling: Temperature, Top-K, Top-P, and Min-P Explained - Let's Data Science, https://letsdatascience.com/blog/llm-sampling-temperature-top-k-top-p-and-min-p-explained

7.     Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation - NIPS, https://papers.neurips.cc/paper_files/paper/2025/file/294de0fa7149adcb88aa3119c239c63e-Paper-Conference.pdf

8.     arXiv:2411.07641v1 [cs.LG] 12 Nov 2024, https://arxiv.org/pdf/2411.07641?

9.     Top-nσ: Eliminating Noise in Logit Space for Robust Token Sampling of LLM - ACL Anthology, https://aclanthology.org/2025.acl-long.528.pdf

10.  Top-n⁢𝜎: Not All Logits Are You Need - arXiv, https://arxiv.org/html/2411.07641v1

11.  Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation - arXiv, https://arxiv.org/html/2509.02510v1

12.  Min P Sampling: Balancing Creativity and Coherence at High Temperature - ResearchGate, https://www.researchgate.net/publication/381882972_Min_P_Sampling_Balancing_Creativity_and_Coherence_at_High_Temperature

13.  Min-k Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit Dynamics - arXiv, https://arxiv.org/html/2604.11012v1

14.  Top-n𝜎: Eliminating Noise in Logit Space for Robust Token Sampling of LLM | Request PDF, https://www.researchgate.net/publication/394303350_Top-n_Eliminating_Noise_in_Logit_Space_for_Robust_Token_Sampling_of_LLM

15.  [2411.07641] Top-$nσ$: Not All Logits Are You Need - arXiv, https://arxiv.org/abs/2411.07641

16.  Top- n σ nsigma : Not All Logits Are You Need - ResearchGate, https://www.researchgate.net/publication/385749971_Top-nsigma_Not_All_Logits_Are_You_Need

17.  The official code repo and data hub of top_nsigma sampling strategy for LLMs. - GitHub, https://github.com/Tomorrowdawn/top_nsigma

18.  [RFC] Add Top-nσ logit truncation example via custom logits processor #45023 - GitHub, https://github.com/vllm-project/vllm/issues/45023

19.  [2509.02510] Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation - arXiv, https://arxiv.org/abs/2509.02510

20.  Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation | Request PDF - ResearchGate, https://www.researchgate.net/publication/395212209_Top-H_Decoding_Adapting_the_Creativity_and_Coherence_with_Bounded_Entropy_in_Text_Generation

21.  Official PyTorch implementation of Top-H decoding—an entropy-aware, training-free sampler that adapts creativity and coherence in LLM text generation. Paper: arXiv:2509.02510 - GitHub, https://github.com/ErfanBaghaei/Top-H-Decoding

22.  acl2026 · GitHub Topics, https://github.com/topics/acl2026

23.  Min-k Sampling: Decoupling Truncation from Temperature Scaling via Relative Logit Dynamics - ACL Anthology, https://aclanthology.org/2026.acl-long.681/

24.  Architecting Modern AI Systems: Platforms, Agents, and Integration - Video, https://home.mlops.community/public/videos/architecting-modern-ai-systems-platforms-agents-and-integration

25.  VAST Data Boosts BUZZ HPC's Sovereign AI Cloud - TechIntelPro, https://techintelpro.com/news/ai/generative-ai/vast-data-boosts-buzz-hpcs-sovereign-ai-cloud

26.  BUZZ HPC Selects VAST Data to Power Sovereign AI, https://www.vastdata.com/press-releases/buzzhpc-selects-vast-data-unlock-future-agentic-computing