الاختبارات المرجعية لنماذج AI
يقوم Reviuws بتشغيل مجموعة اختبارات مرجعية قياسية تشمل الاستدلال، البرمجة، زمن الاستجابة، وكفاءة التكلفة، ويسجل درجة أداء لكل نموذج في الدليل.
- GPT-5.5 benchmark results
- SDXL benchmark results
- Runway Gen-4 benchmark results
- Whisper Large v3 benchmark results
- text-embedding-3-small benchmark results
- GPT Image 2 benchmark results
- o4-mini benchmark results
- Gemini 2.5 Pro benchmark results
- Gemini 2.5 Flash-Lite benchmark results
- text-embedding-004 benchmark results
- Claude Opus 4.1 benchmark results
- Claude Haiku 4.5 benchmark results
- Mistral Large 2 benchmark results
- Codestral 2508 benchmark results
- Whisper-1 benchmark results
- Gemini 2.5 Flash benchmark results
- Gemma 3 benchmark results
- Claude Sonnet 4.5 benchmark results
- Llama 3.3 70B benchmark results
- Mistral Small 3.2 benchmark results
- DeepSeek-V3.1 benchmark results
- DeepSeek-R1 benchmark results
- Qwen2.5-VL-72B benchmark results
- Grok 4.3 benchmark results
- Veo 3.1 benchmark results
- Qwen3-235B-A22B benchmark results
- Qwen 3 235B benchmark results
- Gemini Embedding 2 benchmark results
- Claude Sonnet 5 benchmark results
- GPT-5.6 Luna benchmark results
- Claude Sonnet 4.5 benchmark results
- Grok 4.5 benchmark results
- GPT-5.6 Terra benchmark results
- Claude Fable 5 benchmark results
- Claude Opus 5 benchmark results
- GPT-Realtime 2.1 benchmark results
- DeepSeek V4 Pro benchmark results
- Claude Haiku 4.5 benchmark results
- GPT-5.6 Sol benchmark results
- GPT-5.4 mini benchmark results