El modelo DeepSeek-V3.2-Exp ha sido lanzado oficialmente y es de código abierto.
ChainCatcher informa que el modelo DeepSeek-V3.2-Exp fue lanzado oficialmente y su código ha sido abierto hoy. El modelo introduce una arquitectura de Attention dispersa, la cual puede reducir eficazmente el consumo de recursos computacionales y mejorar la eficiencia de inferencia del modelo. Actualmente, este modelo ya está disponible en la plataforma MaaS (Model as a Service) de Huawei Cloud. Para el modelo DeepSeek-V3.2-Exp, Huawei Cloud sigue utilizando la solución de paralelismo EP a gran escala, implementando una estrategia de paralelismo contextual afinada para secuencias largas basada en la estructura de Attention dispersa, equilibrando tanto la latencia del modelo como el rendimiento de procesamiento.
Descargo de responsabilidad: El contenido de este artículo refleja únicamente la opinión del autor y no representa en modo alguno a la plataforma. Este artículo no se pretende servir de referencia para tomar decisiones de inversión.
También te puede gustar
TotalEnergies (TTE.US) se asocia con Mistral: apuesta 100 millones de euros en IA para exploración, impulsando la "soberanía de IA" europea en escenarios clave del sector energético
TotalEnergies (TTE.US) colaborará con la startup francesa de inteligencia artificial Mistral AI para aprovechar la inteligencia artificial y mejorar su capacidad de exploración de petróleo y gas, así como extender la vida útil de los yacimientos existentes.


El índice Nifty 50 de India cerró con una caída del 1,19%.
¡Por primera vez desde 2017! La demanda de productos de lujo cae y LVMH sale del top 10 de capitalización bursátil en Europa.
LVMH solía ser la acción con mayor valor de mercado en Europa, pero ha salido del top diez debido a la caída en la industria de productos de lujo.

