Mixtral
Opis
Mixtral 8x7B, wysokiej jakości rzadki model mieszanki ekspertów (SMoE) z otwartymi wagami. Mixtral przewyższa Llama 2 70B w większości benchmarków z 6-krotnie szybszą inferencją. Dorównuje lub przewyższa GPT3.5 w większości standardowych benchmarków.<br>Papier: https://arxiv.org/pdf/2401.04088.pdf<br>Wiadomości: https://mistral.ai/news/mixtral-of-experts/
Powiązane narzędzia
DeepSeek-R1
Modele rozumowania pierwszej generacji DeepSeek: DeepSeek-R1-Zero i DeepSeek-R1. DeepSeek-R1-Zero, model trenowany za pomocą uczenia przez wzmacnianie (RL) na dużą skalę bez nadzorowanego dostrajania (SFT) jako wstępnego kroku, wykazał się niezwykłą wydajnością w rozumowaniu.
DeepSeek-V3
Potężny model językowy Mixture-of-Experts (MoE) z łącznie 671B parametrami, z których 37B jest aktywowanych dla każdego tokena.
Llama 3
Llama3 to duży model językowy opracowany przez Meta AI. Jest następcą modelu językowego Llama2 firmy Meta.<br>Adres testu online:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
Duży model językowy open source stworzony przez xAI
Phi-3
Phi-3 to rodzina otwartych modeli AI opracowanych przez Microsoft. Modele Phi-3 to najbardziej wydajne i opłacalne małe modele językowe (SLM) dostępne na rynku, przewyższające modele tej samej wielkości i następnej wielkości w różnych benchmarkach językowych, rozumowania, kodowania i matematyki.
Gemma 4
Gemma 4 to najnowsza seria wielkoskalowych modeli językowych Google o otwartym kodzie źródłowym, zbudowana na architekturze Gemini, oferująca ulepszone osiągi, dłuższe okna kontekstowe i lepsze wsparcie wielojęzyczne.