A DeepSeek, uma startup chinesa fundada por Liang Wenfeng, está a desafiar o domínio das gigantes norte-americanas da Inteligência Artificial (IA) com um modelo inovador e económico.
A eficiência em IA pode ser definida como a capacidade de obter melhores resultados com menos recursos. Isso inclui alcançar um desempenho elevado com menos dados de treino, menor processamento computacional e menor consumo energético. Num cenário onde os modelos de IA Generativa crescem exponencialmente, encontrar formas de otimizar esses fatores sem comprometer a qualidade é um diferencial competitivo. Modelos como os utilizados pelo DeepSeek exemplificam essa tendência, pois conseguem resultados avançados mesmo com um volume reduzido de dados e menor dependência de hardware poderoso. A eficiência é alcançada através de diversas estratégias inovadoras. Um dos principais fatores é a qualidade dos dados, onde a seleção criteriosa e a filtragem de informações irrelevantes tornam o treino mais eficaz. Além disso, técnicas como aprendizado por reforço e pré-treino supervisionado permitem que os modelos aprendam com menos exemplos, mas de forma mais inteligente. Outra abordagem fundamental é o uso de arquiteturas de rotas otimizadas nas redes neuronais, que reduzem a necessidade de cálculos desnecessários.
Diferente de modelos tradicionais como o GPT-4, que possuem milhares de camadas e dependem fortemente de GPUs para processar grandes quantidades de dados, o DeepSeek utiliza estruturas como atenção esparsa e roteamento dinâmico. Isso significa que apenas partes do modelo são ativadas conforme necessário, em vez de processar tudo simultaneamente. Essa abordagem reduz drasticamente a carga computacional e, consequentemente, o consumo energético. Tal como o nome DeepSeek indica, o seu algoritmo pesquisa (Seek) os melhores caminhos na rede de neurónios (Deep Learning) para otimizar o processo. É importante referir que um sistema de Inteligência Artificial Generativa, que inclui os modelos de grande linguagem – LLM, como o ChatGPT ou o Gemini, fazem uso um sistema de Aprendizagem Supervisionada, através de uma rede neuronal (Deep Learning) para obter resultados (respostas). A criação do dataset do LLM é feito a partir de quantidades massivas de informação existente na Internet (e não só), utilizando outros algoritmos como aprendizagem por reforço, onde existe um sistema de recompensas quando o algoritmo responde bem ou de perca de pontos quando toma uma decisão errada.
O DeepSeek elimina a necessidade de grandes clusters de GPUs existentes nos atuais enormes “data centers”, estando também associado a novas técnicas de inferência mais leves. Em oposição, o DeepSeek considera algoritmos mais avançados que podem ser executados em hardware mais simples, como CPUs, tornando a IA mais acessível em termos computacionais e sustentável em termos de custo de processamento e em termos de impacto carbónico. Esta nova eficiência será disruptivo em aplicações que carecem de eficiência energética, como dispositivos móveis, ou soluções empresariais de baixo custo.
Os LLMs podem ser utilizados de duas formas principais: como assistentes interativos para utilizadores comuns, um uso que envolve interações diretas com os utilizadores comuns, em que perguntas são feitas e respostas são fornecidas com base na aprendizagem prévia do modelo, ou como soluções empresariais integradas via Application Programming Interface (API).
No contexto empresarial, o utilizador faz uma pergunta na interface web institucional, a pergunta é enviada, através de uma API, juntamente com um texto contendo toda a informação institucional relevante. O sistema LLM processa a pergunta, busca a resposta no texto enviado e devolve a informação através da API. Finalmente, o Chatbot apresenta a resposta ao utilizador diretamente na interface web.
Enquanto a utilização comum do DeepSeek é oferecida de forma gratuita, mesmo com capacidades avançadas, os valores cobrados às utilizações institucionais para processamento através de API são bastante mais reduzidos, comparativamente com os outros concorrentes, como o ChatGPT ou o Gemini.
Em resumo, estas mudanças no mundo da IA pode representar uma ameaça às grandes tecnológicas porque reduz o custo de entrada – Empresas e desenvolvedores podem adotar a IA da DeepSeek sem gastar milhões em subscrições ou licenças para obter soluções avançadas, tornando-se uma alternativa mais viável.
Por outro lado, desvaloriza modelos pagos – Se a DeepSeek oferecer um desempenho competitivo, os modelos pagos das gigantes podem perder atratividade, forçando-as a baixar preços ou mudar a estratégia de monetização. Também afeta o mercado de hardware – O modelo da DeepSeek funciona com chips menos avançados, o que pode reduzir a procura por componentes de alto desempenho, impactando empresas como Nvidia e ASML.
Portanto, a nova geração de modelos de IA protagonizada pela DeepSeek busca equilibrar potência e eficiência, trazendo resultados comparáveis ou superiores aos modelos gigantescos, mas com menos dados, menos processamento e menor consumo energético. Esse paradigma não apenas reduz custos operacionais, mas também torna a IA mais sustentável, alinhando-se com as crescentes demandas por soluções tecnológicas ecologicamente responsáveis.
A adoção de modelos como o DeepSeek pode ser alvo de preocupações sobre proteção de dados, bem como questões geopolíticas, especialmente no contexto da concorrência tecnológica entre China e EUA. No entanto, é sabido que, atualmente, é difícil compreender onde terminam as questões concorrenciais e protecionistas e iniciam as questões geopolíticas.