Daniel Szabo

Start / DIE KI-Revolution / KW 19/2025

DIE KI-Revolution KW 19/2025

Ausgabe 20Von Daniel Szabo

In dieser Ausgabe: Das Leaderboard-Dilemma: Warum KI-Rankings in die Irre führen; OpenAI rollt sycophantisches Update von ChatGPT zurück; Alibaba bringt mit Qwen 3 ein neues Open-Source-Gewicht ins Spiel.

Inhaltsverzeichnis

  1. Das Leaderboard-Dilemma: Warum KI-Rankings in die Irre führen
  2. OpenAI rollt sycophantisches Update von ChatGPT zurück
  3. Alibaba bringt mit Qwen 3 ein neues Open-Source-Gewicht ins Spiel
  4. Baidu setzt mit ERNIE Turbo auf günstige KI-Leistung
  5. Microsoft Copilot wird zur Business-Suite mit Bildern & Notizen
  6. OpenAI integriert Online-Shopping in ChatGPT
  7. Huawei greift mit Ascend 920 nach NVIDIAs Marktanteilen
  8. Meta öffnet Llama-API für Entwickler & attackiert OpenAI
  9. BitNet: Microsoft zeigt KI-Modell, das nur auf CPU läuft
  10. KI-Versuch auf Reddit: Forscher manipulierten Debatten ohne Zustimmung

1. Das Leaderboard-Dilemma: Warum KI-Rankings in die Irre führen

Eine neue Studie zur Chatbot Arena, einem beliebten KI-Ranking-Portal, legt schwerwiegende Probleme bei der Modellbewertung offen. Die Forscher analysierten über 2 Millionen Modellvergleiche zwischen 243 Modellen von 42 Anbietern. Sie fanden heraus, dass bestimmte Anbieter bevorzugten Zugang zu Testdaten und mehr Präsenz erhalten, wodurch das Ranking systematisch verzerrt wird. Proprietäre Modelle profitierten besonders stark, während Open-Source-Angebote benachteiligt waren. Zudem führen veraltete Deaktivierungsregeln („Deprecation Policies“) dazu, dass längst überholte Modelle in den Top-Platzierungen verweilen. Insgesamt entsteht so ein trügerisches Bild vom tatsächlichen Leistungsstand der KI-Modelle – Fortschritte beruhen häufig auf Gaming statt echter Innovation.

Darum zählt es: Unternehmen, die KI-Modelle auf Basis solcher Ranglisten bewerten, laufen Gefahr, sich auf irreführende oder marketinggesteuerte Metriken zu verlassen. Das kann Fehlinvestitionen oder ineffiziente Technologieentscheidungen zur Folge haben.

Was kann ich jetzt machen: Business-Entscheider sollten nicht nur auf Ranglisten achten, sondern eigene Use-Case-Benchmarks durchführen. Offen lizenzierte Modelle mit transparenten Evaluierungen sind oft zuverlässiger. Interne Tests, Fairness-Kriterien und nachvollziehbare Modell-Dokumentation sind essenziell für fundierte Entscheidungen.

2. OpenAI rollt sycophantisches Update von ChatGPT zurück

Darum zählt es: Für den geschäftlichen Einsatz muss eine KI nicht nur informativ, sondern auch glaubwürdig, konsistent und situativ angemessen kommunizieren. Ein Modell, das alles abnickt, kann Vertrauen untergraben oder sogar schädliche Entscheidungen begünstigen.

Was kann ich jetzt machen: Unternehmen sollten regelmäßig die Antworten ihrer eingesetzten KI-Modelle prüfen – insbesondere bei Kundenkontakt oder Entscheidungsunterstützung. Auch feinjustierte Anpassungen (z. B. über Systemprompts) können helfen, den passenden Kommunikationsstil für die jeweilige Branche zu etablieren.

3. Alibaba bringt mit Qwen 3 ein neues Open-Source-Gewicht ins Spiel

Alibaba hat mit Qwen 3 eine neue Familie von KI-Sprachmodellen vorgestellt. Die Bandbreite reicht von 0,6 bis 235 Milliarden Parametern. Die Modelle wurden auf über 36 Billionen Tokens in 119 Sprachen trainiert. Besonders innovativ ist die Kombination aus klassischem Sprachverständnis und sogenannten „hybriden Reasoning-Fähigkeiten“. Einige Versionen setzen auf Mixture-of-Experts-Architekturen, um Rechenleistung effizienter zu nutzen. Erste Benchmarks zeigen, dass der größte veröffentlichte Ableger – Qwen3-32B – mit führenden proprietären Modellen wie GPT-4 oder Claude 3 mithalten kann. Die Modelle sind unter einer offenen Lizenz erhältlich und auf Plattformen wie GitHub oder Hugging Face zugänglich. Das macht Qwen 3 besonders attraktiv für Unternehmen, die eigene Anwendungen entwickeln oder KI-Infrastruktur unabhängig aufbauen möchten.

Darum zählt es: Open-Weight-Modelle mit hoher Qualität werden zu einer ernsthaften Alternative zu kostenpflichtigen API-Angeboten. Damit entsteht mehr Wettbewerb – und mehr Spielraum für maßgeschneiderte KI-Lösungen in Unternehmen.

Was kann ich jetzt machen: Prüfen Sie, ob Sie durch Qwen 3 bestehende Lizenzkosten reduzieren oder Ihre Systeme unabhängiger gestalten können. Besonders für Tech-Teams mit Know-how in MLOps ist Qwen 3 ein spannender Baustein für die eigene KI-Strategie.

4. Baidu setzt mit ERNIE Turbo auf günstige KI-Leistung

Baidu hat zwei neue Modelle vorgestellt, die besonders im Preis-Leistungs-Verhältnis hervorstechen: ERNIE X1 Turbo und ERNIE 4.5 Turbo. Beide Modelle wurden weiterentwickelt, um komplexe Aufgaben effizienter zu lösen – etwa durch verbesserte Multimodalität und Tool-Nutzung. Besonders bemerkenswert ist die Preisstruktur: ERNIE X1 Turbo kostet nur etwa 25 % des vergleichbaren DeepSeek R1, während ERNIE 4.5 Turbo sogar 80 % günstiger als sein Vorgänger ist. Trotz der Kostenreduktion liefern beide Modelle beeindruckende Resultate in Benchmarks und übertreffen in einigen Fällen sogar OpenAI’s GPT-4o. Baidu positioniert sich damit als ernstzunehmender Konkurrent – besonders für kostensensible Märkte und Unternehmen, die hohe Anforderungen an Text-, Bild- und Toolfähigkeiten stellen.

Darum zählt es: Die Debatte um KI-Kosten wird durch Baidus Modelle neu entfacht. Wer große Datenmengen verarbeitet oder viele Anfragen stellt, profitiert deutlich – sowohl bei Performance als auch beim Budget.

Was kann ich jetzt machen: Vergleichen Sie Baidus neue Modelle mit bisherigen Anbietern in Ihren Use-Cases. Wenn Skalierung oder Kosteneffizienz wichtig sind, bieten ERNIE-Modelle eine starke Alternative – insbesondere für Customer Support, Knowledge Management oder Content-Produktion.

5. Microsoft Copilot wird zur Business-Suite mit Bildern & Notizen

Microsoft hat seine 365-Copilot-Suite stark erweitert und verfolgt eine neue Strategie: Weg vom reinen Office-Assistenten hin zur vollintegrierten KI-Arbeitsumgebung. Neu ist u. a. eine projektbasierte Notizfunktion („Notebooks“) mit KI-Unterstützung, eine Bildgenerierung direkt in PowerPoint und Word sowie ein überarbeiteter AI-Suchdienst, der Inhalte kontextuell durchsuchbar macht. Zusätzlich führt Microsoft einen sogenannten „Agent Store“ ein, über den Drittanbieter KI-Module beisteuern können. Nutzer sollen so Workflows individuell erweitern. Diese Entwicklung bringt Copilot näher an klassische Productivity- und Kreativlösungen heran und differenziert sich von anderen Anbietern durch tiefe Integration in Microsofts Ökosystem.

Darum zählt es: KI wird vom passiven Helfer zur aktiven Plattform. Unternehmen können mit Copilot nun Aufgaben quer über Tools hinweg automatisieren, visualisieren und strukturieren – ein echter Produktivitätsschub.

Was kann ich jetzt machen: Testen Sie die neuen Funktionen in einer Pilotabteilung. Besonders Marketing, Vertrieb oder PMO-Teams profitieren von den Notebooks und Bildfunktionen. Der Agent Store eröffnet zudem neue Wege, branchenspezifische KI-Lösungen zu integrieren – ohne eigene Entwicklungskosten.

6. OpenAI integriert Online-Shopping in ChatGPT

OpenAI hat eine neue Shopping-Funktion in ChatGPT integriert, die es Nutzern ermöglicht, direkt über das KI-Interface personalisierte Produktempfehlungen zu erhalten – inklusive Bilder, Rezensionen und Kauf-Links. Das Besondere: Es handelt sich nicht um Werbung, sondern um kuratierte Empfehlungen auf Basis des Gesprächskontexts. Langfristig soll auch die neue Speicherfunktion von ChatGPT genutzt werden, um Nutzerpräferenzen zu berücksichtigen. Erste Tests zeigen hohes Nutzerinteresse, vor allem für Technik, Mode und Haushaltsgeräte. Die Funktion startet vorerst in der Desktop-Version und könnte künftig über Partner erweitert werden – OpenAI betont aber, unabhängig von klassischen Werbenetzwerken zu agieren.

Darum zählt es: Mit dieser Entwicklung mischt OpenAI im E-Commerce mit – und bringt eine neue Form des „Conversational Commerce“ in den Alltag. Unternehmen sollten sich darauf einstellen, dass KI-Systeme künftig als Vertriebskanal fungieren.

Was kann ich jetzt machen: Überprüfen Sie, wie Ihre Produkte strukturiert und auffindbar sind. Wer früh auf KI-kompatible Produktdaten setzt, kann bei neuen Verkaufskanälen wie ChatGPT profitieren. Auch eine API-Integration in eigene Shops könnte mittelfristig sinnvoll werden.

7. Huawei greift mit Ascend 920 nach NVIDIAs Marktanteilen

Huawei hat den Ascend 920 vorgestellt – einen neuen KI-Beschleunigerchip, der als direkte Antwort auf NVIDIAs H100 gilt. Der Chip ist für Trainings- und Inferenzanwendungen optimiert und soll vor allem im chinesischen Markt zum Einsatz kommen, wo NVIDIA aufgrund von Exportbeschränkungen kaum noch präsent ist. Huawei betont, dass der Ascend 920 sowohl energieeffizienter als auch günstiger sei – bei vergleichbarer Leistung. Neben dem Chip plant Huawei auch eine umfassende Softwareplattform, um Entwicklung und Betrieb zu erleichtern. Die neue Hardware wird bereits in mehreren staatlichen Projekten getestet und soll zur digitalen Souveränität Chinas beitragen.

Darum zählt es: Die globale KI-Infrastruktur ist stark von US-Technologie abhängig. Huawei schafft mit dem Ascend 920 eine glaubwürdige Alternative – und könnte damit die Technologielandschaft in Asien dauerhaft verändern.

Was kann ich jetzt machen: Unternehmen mit Bezug zu Asien oder eigener Hardwarestrategie sollten prüfen, ob sie sich strategisch unabhängiger aufstellen können. Auch in Europa könnten Huawei-Chips bei lokalen, datenschutzkritischen KI-Projekten mittelfristig eine Rolle spielen.

8. Meta öffnet Llama-API für Entwickler & attackiert OpenAI

Meta hat seine Llama-Modelle nun über eine öffentliche API zugänglich gemacht. Entwickler können damit Anwendungen auf Basis der offenen LLMs von Meta bauen – inklusive Fine-Tuning, Hosting und Evaluierung. Die Llama-API läuft wahlweise über Partner wie Cerebras oder Groq, was Flexibilität bei der Infrastruktur bietet. Meta will damit OpenAIs Vormachtstellung angreifen und setzt klar auf Offenheit und Datenschutz. Beim hauseigenen Entwickler-Event „LlamaCon“ wurde deutlich, dass Meta in Richtung Plattform-Ökosystem denkt – mit Tools, Sicherheit und Kontrolle als zentralen Säulen.

Darum zählt es: Unternehmen erhalten eine datenschutzfreundliche und kostengünstige Alternative zu OpenAI. Die Llama-Modelle bieten hohe Qualität und jetzt auch die Infrastruktur für professionelle Nutzung – besonders für regulierte Branchen attraktiv.

Was kann ich jetzt machen: Entwickeln Sie erste Prototypen auf Basis der Llama-API, um Potenzial und Grenzen auszuloten. Besonders in den Bereichen LegalTech, Gesundheitswesen oder Finanzen können selbstgehostete oder feinjustierte Modelle einen strategischen Vorteil bieten.

9. BitNet: Microsoft zeigt KI-Modell, das nur auf CPU läuft

Microsoft hat mit BitNet b1.58 ein innovatives Sprachmodell präsentiert, das auf reiner CPU-Infrastruktur läuft – und trotzdem mit deutlich größeren GPU-basierten Systemen konkurrieren kann. Möglich wird das durch eine ternäre Architektur, die nur drei Werte (-1, 0, 1) nutzt und damit extrem speichereffizient arbeitet. Das Modell eignet sich besonders für edge devices, kostensensitive Anwendungen oder Unternehmen, die keine dedizierten Grafikkarten einsetzen wollen oder können. In Benchmarks zeigte BitNet konkurrenzfähige Ergebnisse bei deutlich geringerem Energiebedarf und Hardwareeinsatz.

Darum zählt es: BitNet bricht mit der Annahme, dass nur GPU-Cluster moderne KI leisten können. Gerade für KMUs, IoT-Anwendungen oder Embedded-Systeme eröffnen sich völlig neue Möglichkeiten.

Was kann ich jetzt machen: Überlegen Sie, welche KI-Prozesse in Ihrem Unternehmen mit CPU-basierten Modellen realisiert werden könnten. BitNet kann z. B. als Sprachmodell für Chatbots, lokale Analyse oder interne Tools eine nachhaltige und günstige Lösung bieten.

10. KI-Versuch auf Reddit: Forscher manipulierten Debatten ohne Zustimmung

Ein Forschungsteam der Universität Zürich hat ohne Genehmigung ein groß angelegtes Experiment auf Reddit durchgeführt. Mittels KI-gesteuerter Bots wurden Diskussionen auf dem Subreddit r/changemyview beeinflusst. Ziel war es, die Wirkung von KI-gesteuerter Überzeugung zu untersuchen – allerdings ohne Wissen der Nutzer oder der Plattform. Das Vorgehen löste massive Kritik aus, Reddit erwägt rechtliche Schritte. Die Forscher rechtfertigen sich mit dem wissenschaftlichen Erkenntnisgewinn, räumen aber ethische Versäumnisse ein. Die Debatte um unautorisierte KI-Interaktionen im Netz nimmt damit Fahrt auf – auch wegen der zunehmenden Ununterscheidbarkeit zwischen Mensch und Maschine.

Darum zählt es: Der Fall zeigt, wie einfach KI zur Manipulation eingesetzt werden kann – selbst in sensiblen gesellschaftlichen Debatten. Unternehmen müssen sich auf neue Risiken im Reputationsmanagement einstellen.

Was kann ich jetzt machen: Schulen Sie Ihre Teams im Erkennen von KI-generierten Inhalten und überprüfen Sie Ihre Kommunikationsstrategie auf Robustheit gegenüber automatisierten Beeinflussungsversuchen. Auch Compliance-Vorgaben sollten um KI-Aspekte erweitert werden.

Auf LinkedIn teilen · ·

Verwandte Inhalte

So zitieren: Szabo, Daniel (5. Mai 2025): „DIE KI-Revolution KW 19/2025“. szabo.digital, https://szabo.digital/ki-revolution/kw-19-2025/

Jede Woche neu.

DIE KI-Revolution erscheint wöchentlich auf LinkedIn. Zehn Meldungen, jeweils eingeordnet, mit einem konkreten nächsten Schritt.

Auf LinkedIn abonnieren

Ursprünglich veröffentlicht auf LinkedIn.