Mixtral
설명
Mixtral 8x7B, 오픈 가중치를 가진 고품질 스파스 혼합 전문가 모델(SMoE)입니다. Mixtral은 대부분의 벤치마크에서 Llama 2 70B를 능가하며 추론 속도는 6배 빠릅니다. 대부분의 표준 벤치마크에서 GPT3.5와 동등하거나 더 우수합니다.<br>논문: https://arxiv.org/pdf/2401.04088.pdf<br>뉴스: https://mistral.ai/news/mixtral-of-experts/
관련 도구
DeepSeek-R1
DeepSeek의 1세대 추론 모델인 DeepSeek-R1-Zero와 DeepSeek-R1. DeepSeek-R1-Zero는 지도 미세 조정(SFT) 없이 대규모 강화 학습(RL)으로 훈련된 모델로, 추론에서 뛰어난 성능을 입증했습니다.
DeepSeek-V3
강력한 Mixture-of-Experts(MoE) 언어 모델로, 총 671B 파라미터 중 각 토큰에 대해 37B가 활성화됩니다.
Llama 3
Llama3는 Meta AI가 개발한 대규모 언어 모델입니다. Meta의 Llama2 언어 모델의 후속 모델입니다.<br>온라인 테스트 주소:<br>[huggingface.co/Meta-Llama-3-70B-Instruct](https://huggingface.co/chat/models/meta-llama/Meta-Llama-3-70B-Instruct)
grok-1
xAI가 오픈소스화한 대규모 언어 모델
Phi-3
Phi-3는 Microsoft가 개발한 오픈 AI 모델 제품군입니다. Phi-3 모델은 현재 사용 가능한 가장 강력하고 비용 효율적인 소형 언어 모델(SLM)로, 다양한 언어, 추론, 코딩 및 수학 벤치마크에서 동일한 크기 및 그 다음 크기의 모델보다 뛰어난 성능을 보여줍니다.
Gemma 4
Gemma 4는 Google의 최신 오픈소스 대규모 언어 모델 시리즈로, Gemini 아키텍처를 기반으로 구축되어 향상된 성능, 더 긴 컨텍스트 창, 더 나은 다국어 지원을 제공합니다.