Catch pre-market movers with AI signals.
Amazon Paper revela que la política KV-Cache influye en la inferencia y el entrenamiento de modelos con contexto largo.
- La investigación de Amazon demuestra que la falta de alineación entre el ajuste fino de la atención y las políticas de caché KV para la inferencia causaFallas en el contexto largo en los modelos de lenguaje grandes.
- El entrenamiento de modelos con atención escasa, de acuerdo con la política de caché de inferencia, evita resultados sin sentido.Mejora la fiabilidad en contextos con 128k tokens..
- Los hallazgos subrayan la necesidad estructural de alinear los regímenes de entrenamiento con las restricciones de inferencia, para el despliegue de LLM con recursos limitados.
- AWS aprovecha esta precisión técnica, además de…Una asociación de 100 mil millones de dólares con Anthropic.Para impulsar el crecimiento de la infraestructura de IA.
- Los inversores vigilan si los costos más bajos de los tokens de IA podrán estimular una demanda suficiente.El desplazamiento redujo los costos de computación por unidad..
Los investigadores de Amazon han publicado resultados que indican que la selección de las políticas de caché tipo clave-valor no es simplemente una optimización de procesamiento, sino que, en realidad, cambia fundamentalmente el proceso de entrenamiento necesario para los modelos de lenguaje grandes. El estudio destaca una vulnerabilidad crítica en las prácticas actuales de implementación: los modelos que se han entrenado con mecanismos de atención completa se utilizan con atención “esparsa” durante el procesamiento. La atención “esparsa” reduce el uso de memoria, ya que solo se conserva un subconjunto del contexto pasado en una caché KV de tamaño fijo. Esto genera una discrepancia grave cuando el modelo se encuentra con información ausente del contexto previo. Esta discrepancia suele llevar a la generación de respuestas largas e incomprensibles cuando se procesan contextos extensos.
La investigación propone una solución estructural que consiste en alinear el proceso de ajuste fino directamente con la política de caché KV de inferencia. Al entrenar los modelos para que esperen un memoria de contexto parcial, aprenden a responder y detenerse de manera adecuada, a pesar de la falta de información. En pruebas que involucraron 128k contextos, los modelos entrenados con este enfoque mantuvieron un comportamiento coherente, mientras que aquellos entrenados con atención total fallaron significativamente en condiciones de inferencia escasa. Este método hace que el entrenamiento según políticas de caché sea práctico para cualquier política de caché posible, permitiendo así el cálculo de gradientes para un modelo con 4B de parámetros en una GPU A100 de 40 GB.
¿Por qué la política de KV-Cache es importante para la implementación de LLM?
La alineación entre el entrenamiento y la inferencia es esencial para mantener la fiabilidad del modelo en entornos de producción. Cuando los grandes modelos de lenguaje se optimizan para un contexto histórico completo durante el ajuste fino, pero se ven obligados a operar con una memoria truncada durante la inferencia, su rendimiento disminuye significativamente. El artículo publicado por Amazon demuestra que esta discrepancia afecta al comportamiento del modelo, especialmente en trabajos donde es necesario mantener un contexto constante. Al simular las restricciones de memoria durante la fase de entrenamiento, los modelos desarrollan robustez frente a la pérdida de contexto. Este enfoque evita las hallucinations y los problemas lógicos que suelen ocurrir en aplicaciones que requieren un gran contexto.
La viabilidad computacional de este método representa un avance significativo, ya que permite su implementación práctica en hardware estándar. La capacidad de calcular gradientes para el entrenamiento de políticas en una GPU A100 de 40 GB hace que las técnicas de optimización avanzadas estén accesibles a todos. Este avance técnico contribuye al cambio hacia infraestructuras de IA más eficientes y confiables en la industria en general. A medida que las empresas implementan modelos más grandes, el costo de gestionar los “ventanas de contexto” se convierte en una limitación importante.

¿Cómo utiliza AWS los avances tecnológicos para impulsar el crecimiento?
Amazon Web Services está integrando estas eficiencias técnicas en una estrategia más amplia, basada en una alianza de 100 mil millones de dólares con Anthropic. AWS ha integrado los modelos Claude de Anthropic en Amazon Bedrock, lo que permite reducir los costos y hacer que las cargas de trabajo basadas en tokens sean hasta un 45% más económicas para las aplicaciones agentes. Esta ventaja en precios está respaldada por un compromiso de diez años por parte de Anthropic para utilizar la tecnología de AWS, reservando hasta cinco gigavatios de capacidad. Más de 100,000 clientes actualmente utilizan Claude a través de Bedrock, lo que indica una fuerte adopción inicial de estos servicios optimizados.
El enfoque estratégico se centra en aumentar el volumen de ventas, a fin de compensar los costos de computación más bajos por unidad. AWS generó 42.2 mil millones de dólares en el último trimestre, lo que representa 168.8 mil millones de dólares anualmente.Las soluciones de IA están impulsando el crecimiento más rápido.En 18 trimestres. El compromiso anual promedio de Anthropic de 10 mil millones de dólares representa aproximadamente el 5.9% de esta tasa de crecimiento continuo. Amazon se beneficia si el aumento en la carga de trabajo supera los beneficios en eficiencia que provienen de precios más bajos, lo que acelera los ingresos totales.
AWS también planea implementar dos millones de GPU NVIDIA adicionales durante los años 2027 y 2028, lo que indica una demanda a largo plazo. Esta expansión incluye GPUs Blackwell Ultra, Rubin y Rubin Ultra, además de equipos de red y CPUs Vera de NVIDIA. La idea principal de inversión de Amazon se basa en la utilización eficiente de la capacidad de computación limitada, combinándola con almacenamiento y servicios de IA gestionados. Sin embargo, el punto débil radica en la eficiencia del uso de capital, ya que los planes de implementación no garantizan una utilización efectiva de los recursos, ni protegen contra la depreciación rápida del hardware.
Los ingresos de Amazon en el año fiscal 2025 alcanzaron los 716.9 mil millones de dólares, gracias a un ecosistema en el que los negocios minoristas apoyan la publicidad, mientras que AWS proporciona flujos de caja. La empresa cotiza a un P/E de 23.9x, en comparación con competidores como Uber, que tiene un P/E de 17.2x. Ambas empresas están desarrollando vehículos autónomos controlados por IA; Zoox, de Amazon, ha recibido permiso federal para cobrar por servicios de transporte. La combinación de precisión técnica en el entrenamiento de LLMs y las inversiones masivas en infraestructura permiten a Amazon aprovechar el futuro impulsado por la IA. Los inversores deben considerar la solidez del rendimiento de AWS en relación con los riesgos asociados a los ciclos de implementación que requieren mucho capital.
Mezclando la sabiduría tradicional del comercio con las perspectivas innovadoras sobre las criptomonedas.



Comentarios
Aún no hay comentarios