DeepSeek-V4
Opis
Flagowy model DeepSeek czwartej generacji. V4-Pro (1.6T MoE) i V4-Flash (284B MoE) oferują kontekst 1M, natywną multimodalność i Hybrid Attention dla ekstremalnej wydajności.
Powiązane narzędzia
DeepSeek-R1
Modele rozumowania pierwszej generacji DeepSeek: DeepSeek-R1-Zero i DeepSeek-R1. DeepSeek-R1-Zero, model trenowany za pomocą uczenia przez wzmacnianie (RL) na dużą skalę bez nadzorowanego dostrajania (SFT) jako wstępnego kroku, wykazał się niezwykłą wydajnością w rozumowaniu.
DeepSeek-V3
Potężny model językowy Mixture-of-Experts (MoE) z łącznie 671B parametrami, z których 37B jest aktywowanych dla każdego tokena.
Llama 3
Llama3 to duży model językowy opracowany przez Meta AI. Jest następcą modelu językowego Llama2 firmy Meta.<br>Adres testu online:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
Duży model językowy open source stworzony przez xAI
Phi-3
Phi-3 to rodzina otwartych modeli AI opracowanych przez Microsoft. Modele Phi-3 to najbardziej wydajne i opłacalne małe modele językowe (SLM) dostępne na rynku, przewyższające modele tej samej wielkości i następnej wielkości w różnych benchmarkach językowych, rozumowania, kodowania i matematyki.
Gemma 4
Gemma 4 to najnowsza seria wielkoskalowych modeli językowych Google o otwartym kodzie źródłowym, zbudowana na architekturze Gemini, oferująca ulepszone osiągi, dłuższe okna kontekstowe i lepsze wsparcie wielojęzyczne.