Azure AI Foundry bietet Zugang zu verschiedenen KI-Modellen. Die richtige Wahl ist entscheidend für Erfolg und Kosten.
Model Catalog
Azure OpenAI
GPT-4 Turbo (gpt-4-turbo)
- Stärken: Reasoning, komplexe Aufgaben
- Context: 128K Tokens
- Kosten: Mittel-Hoch
- Use Cases: Analyse, Coding, Beratung
GPT-4o
- Stärken: Multimodal, schnell
- Context: 128K Tokens
- Kosten: Mittel
- Use Cases: Vision, Audio, Chat
GPT-4o-mini
- Stärken: Schnell, kosteneffizient
- Context: 128K Tokens
- Kosten: Niedrig
- Use Cases: Einfache Chats, Klassifizierung
Meta Llama
Llama 3.1 (70B/405B)
- Stärken: Open-Source, keine Vendor-Lock
- Context: 128K Tokens
- Kosten: Variabel
- Use Cases: On-Premise, Custom Fine-Tuning
Llama 3.2 Vision
- Stärken: Bildverständnis
- Context: 128K Tokens
- Use Cases: Dokumentenanalyse, Bildverarbeitung
Microsoft Phi
Phi-4
- Stärken: Klein, effizient, Reasoning
- Context: 16K Tokens
- Kosten: Sehr niedrig
- Use Cases: Edge, schnelle Antworten
Phi-3.5
- Stärken: Multilingual, Vision
- Context: 128K Tokens
- Use Cases: Mehrsprachige Apps
Mistral
Mistral Large
- Stärken: Europäisch, DSGVO
- Context: 32K Tokens
- Kosten: Mittel
- Use Cases: EU-Compliance wichtig
Entscheidungskriterien
1. Aufgaben-Komplexität
- Einfach (Klassifizierung): Phi-4, GPT-4o-mini
- Mittel (Zusammenfassung): GPT-4o, Llama 3.1 70B
- Komplex (Analyse, Code): GPT-4 Turbo, Llama 3.1 405B
2. Latenz-Anforderungen
- Echtzeit (<1s): Phi-4, GPT-4o-mini
- Normal (1-5s): GPT-4o, Llama 3.1 70B
- Tolerant (>5s): GPT-4 Turbo, Llama 405B
3. Kosten
- Minimal: Phi-4
- Begrenzt: GPT-4o-mini, Llama
- Flexibel: GPT-4o, GPT-4 Turbo
4. Compliance
- Standard: Alle Azure-Modelle
- EU-Fokus: Mistral
- Volle Kontrolle: Llama (Self-hosted)
Hybrid-Strategien
Router-Pattern
Anfragen werden klassifiziert und an das passende Modell weitergeleitet: Einfach → Phi-4, Mittel → GPT-4o, Komplex → GPT-4 Turbo
Fallback-Kette
Bei Fehlern wird automatisch auf das nächste Modell gewechselt: GPT-4o → Llama 3.1 → Phi-4
Kosten-Beispiel
Für 1 Million Tokens (Input + Output):
- Phi-4: ca. CHF 0.50
- GPT-4o-mini: ca. CHF 2.00
- GPT-4o: ca. CHF 15.00
- GPT-4 Turbo: ca. CHF 30.00
Preise Stand Januar 2026, können variieren
CNEXT-Empfehlung
Unsere Erfahrung zeigt:
- 1Starten Sie klein – Phi-4 oder GPT-4o-mini
- 2Messen Sie – Qualität und Kosten tracken
- 3Skalieren Sie smart – Grössere Modelle nur wo nötig
- 4Testen Sie Alternativen – Llama für spezifische Fälle
Fazit
Die Modellwahl beeinflusst Qualität, Geschwindigkeit und Kosten. CNEXT hilft bei der optimalen Strategie.

