¿Qué es DeepSeek, el rival de ChatGPT? ¿Cómo se utiliza DeepSeek?
El campo de la inteligencia artificial experimenta avances nuevos y emocionantes cada día. Recientemente, el nombre que ha captado la atención en este sector es el chino DeepSeek. Entonces, ¿qué es exactamente DeepSeek y cómo se utiliza?
12punto
La inteligencia artificial está influyendo profundamente en la tecnología del futuro y del presente. El nombre más comentado últimamente en el mundo de la IA ha sido el chino DeepSeek. Entonces, ¿qué es DeepSeek? ¿Cómo se utiliza DeepSeek?
¿QUÉ ES DEEPSEEK?
DeepSeek es un laboratorio de investigación de inteligencia artificial con sede en China que se centra en el desarrollo de modelos de lenguaje grande (LLM) de código abierto. La empresa fue fundada en 2023 por Liang Wenfeng, fundador y director del fondo de cobertura High-Flyer, con el objetivo de avanzar en sus trabajos en el campo de la inteligencia artificial. Anteriormente, High-Flyer era conocido por desarrollar algoritmos de trading basados en inteligencia artificial.
DeepSeek Coder (noviembre de 2023): Este modelo, dirigido específicamente a tareas de programación, se ofreció de forma gratuita tanto para investigadores como para usuarios comerciales. El modelo fue publicado como código abierto bajo la licencia MIT.
MODELOS DESARROLLADOS
DeepSeek LLM (noviembre de 2023): Con 67 mil millones de parámetros, este modelo fue diseñado para competir con modelos de lenguaje grande como GPT-4. Sin embargo, enfrentó algunos desafíos en términos de eficiencia computacional y escalabilidad. La versión de chatbot del modelo, DeepSeek Chat, también se lanzó en el mismo periodo.
DeepSeek-V2 (mayo de 2024): Lanzado a un costo menor en comparación con sus competidores (2 RMB por millón de tokens de salida), este modelo ocupó el séptimo lugar en el ranking del Tiger Lab de la Universidad de Waterloo.
DeepSeek-V3 (diciembre de 2024): Con 671 mil millones de parámetros, este modelo fue entrenado durante aproximadamente 55 días sobre un conjunto de datos masivo de 14,8 billones de tokens. El costo total del proceso de entrenamiento fue de 5,58 millones de dólares estadounidenses. Con su rendimiento, el modelo superó a Llama 3.1 y Qwen 2.5, alcanzando un nivel equivalente a GPT-4o y Claude 3.5 Sonnet.
DeepSeek R1-Lite-Preview (noviembre de 2024): Este modelo se especializa en inferencia lógica, razonamiento matemático y resolución de problemas en tiempo real. Ha mostrado un rendimiento similar al modelo o1 de OpenAI.