Mixtral
Kuvaus
Mixtral 8x7B, korkealaatuinen harva asiantuntijoiden sekoitusmalli (SMoE), jonka painot ovat avoimet. Mixtral ylittää Llama 2 70B:n useimmissa vertailuissa 6 kertaa nopeammalla päätöksenteolla. Se vastaa tai ylittää GPT3.5:n useimmissa vakioväitteissä.<br>Paperi: https://arxiv.org/pdf/2401.04088.pdf<br>Uutiset: https://mistral.ai/news/mixtral-of-experts/
Samankaltaiset työkalut
DeepSeek-R1
DeepSeekin ensimmäisen sukupolven päättelymallit, DeepSeek-R1-Zero ja DeepSeek-R1. DeepSeek-R1-Zero, malli, joka on koulutettu laajamittaisella vahvistusoppimisella (RL) ilman ohjattua hienosäätöä (SFT) alustavana vaiheena, osoitti huomattavaa suorituskykyä päättelyssä.
DeepSeek-V3
Vahva Mixture-of-Experts (MoE) -kielimalli, jossa on yhteensä 671B parametria, joista 37B aktivoituu jokaista tokenia kohden.
Llama 3
Llama3 on Meta AI:n kehittämä suuri kielimalli. Se on Meta:n Llama2-kielimallin seuraaja.<br>Online-testiosoite:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
Suuri kielimalli, jonka xAI on julkaissut avoimena lähdekoodina
Phi-3
Phi-3 on Microsoftin kehittämä avoimien tekoälymallien perhe. Phi-3-mallit ovat kyvykkäimpiä ja kustannustehokkaimpia saatavilla olevia pieniä kielimalleja (SLM), jotka ylittävät samankokoiset ja seuraavan kokoiset mallit useissa kieli-, päättely-, koodaus- ja matematiikan vertailuarvoissa.
Gemma 4
Gemma 4 on Googlen uusin avoimen lähdekoodin suurten kielimallien sarja, joka on rakennettu Gemini-arkkitehtuurin päälle ja tarjoaa paremman suorituskyvyn, pidemmät konteksti-ikkunat ja paremman monikielisen tuen.