Deepseek revoluciona la carrera por la ia con su modelo v4
La startup china DeepSeek ha lanzado dos versiones de su nuevo modelo de inteligencia artificial, el V4, a apenas un año después de sorprender al mundo y Silicon Valley con su modelo R1. Según la propia empresa, este modelo de código abierto es más potente que los de competidores como OpenAI o Anthropic.

Deepseek presenta dos versiones del v4: flash y pro
La startup china presentó dos versiones de su modelo V4, el V4 Flash y el V4 Pro, destacando su rendimiento superior en pruebas de codificación y grandes avances en razonamiento y tareas de agentes. Según informó la startup en Hugging Face, estas series incorporan mejoras de arquitectura y optimización.
DeepSeek resaltó una técnica denominada Arquitectura de Atención Híbrida, que, según la compañía, mejora la capacidad de una plataforma de IA para recordar consultas durante conversaciones extensas. Además, impulsó la ventana de contexto de un millón de tokens, un avance que permite enviar bases de código completas o documentos extensos como una sola solicitud.
La capacidad de servicio de la serie V4 Pro es extremadamente limitada debido a la escasez de recursos informáticos. Sin embargo, la startup prevé que el precio del modelo disminuya significativamente tras el lanzamiento de los clústeres de computación equipados con los chips Ascend 950 de Huawei en la segunda mitad de este año.
DeepSeek se encuentra actualmente en conversaciones con Tencent y Alibaba para su primera ronda de financiación. Las acciones de Semiconductor Manufacturing International, el principal fabricante de chips de Huawei, subieron hasta un 9,4% en Hong Kong, mientras que las de Hua Hong Semiconductor se dispararon más de un 13%. Sus rivales, como Knowledge Atlas Technology JSC Ltd. (o Zhipu), cayeron un 8%.
La nueva serie representa un gran avance en la escala y la eficiencia que han caracterizado el ascenso de DeepSeek y han ejercido una enorme presión competitiva sobre sus rivales. Tras el lanzamiento del R1, las empresas tecnológicas y los inversores comenzaron a replantearse la conveniencia de invertir miles de millones de dólares en el desarrollo de la IA.
El sistema de un billón de parámetros de DeepSeek utiliza la técnica de mezcla de expertos, que activa selectivamente solo un pequeño subconjunto de expertos y solo hasta 37 mil millones de parámetros por tarea para mantener los costos de inferencia mucho más bajos que para modelos de frontera similares.
El V4 está diseñado para implementarse en infraestructuras más económicas.
