Ist Gemma 2 oder Llama 3 das beste Open-Source-Modell?

Auf der I/O 2024 kündigte Google die nächste Gemma 2-Modellreihe an und veröffentlichte die leichten Modelle nun endlich unter einer Open-Source-Lizenz. Das neue Modell Gemma 2 27B soll vielversprechend sein und einige der größeren Modelle wie Llama 3 70B und Qwen 1.5 32B übertreffen. Um diese Aussage zu überprüfen, vergleichen wir Gemma 2 und Llama 3 – zwei der derzeit besten Open-Source-Modelle.

Kreatives Schreiben

Lassen Sie uns zunächst testen, wie gut Gemma 2 und Llama 3 beim kreativen Schreiben abschneiden. Der Autor des Artikels bat beide Modelle, eine Kurzgeschichte über die Beziehung zwischen Mond und Sonne zu schreiben. Beide schnitten sehr gut ab, aber Googles Gemma 2-Modell stach mit seiner interessanten Prosa und der guten Geschichte hervor.

Ist Gemma 2 oder Llama 3 das beste Open-Source-Modell?
Ist Gemma 2 oder Llama 3 das beste Open-Source-Modell?

Andererseits wirkt das Llama 3 etwas langweilig und roboterhaft. Google war mit seinen Gemini-Modellen schon immer gut darin, Text zu generieren, und das kleinere Gemma 2 27B bildet da keine Ausnahme.

Gewinnoption: Gemma 2

Mehrsprachiges Testen

In der nächsten Runde wollen wir sehen, wie gut beide Modelle mit anderen Sprachen als Englisch umgehen. Da Google damit wirbt, dass Gemma 2 mehrere Sprachen gut versteht, habe ich es mit Metas Llama 3-Modell verglichen. Ich habe beide Modelle gebeten, einen Text in Hindi zu übersetzen. Sowohl Gemma 2 als auch Llama 3 schnitten sehr gut ab.

Ist Gemma 2 oder Llama 3 das beste Open-Source-Modell?
Ist Gemma 2 oder Llama 3 das beste Open-Source-Modell?

Der Autor probierte auch eine weitere Sprache, Bengalisch, aus, und die Modelle zeigten eine ähnlich gute Leistung. Zumindest für indische Sprachen lässt sich sagen, dass Gemma 2 und Llama 3 auf einem großen Korpus gut trainiert wurden. Gemma 2 27B ist jedoch fast 2,5-mal kleiner als Llama 3 70B, was es noch beeindruckender macht.

Gewinnoptionen: Gemma 2 und Llama 3

Testen Sie Ihre Argumentation

Gemma 2 und Llama 3 gehören zwar nicht zu den intelligentesten Modellen auf dem Markt, können aber einige gängige Denktests genauso gut durchführen wie deutlich größere Modelle. Im vorherigen Vergleich zwischen Llama 3 und GPT-4 überzeugte Metas 70B-Modell, da es trotz seiner geringeren Größe eine recht gute Intelligenz zeigte.

Ist Gemma 2 oder Llama 3 das beste Open-Source-Modell?
Ist Gemma 2 oder Llama 3 das beste Open-Source-Modell?

In dieser Runde schlug Lama 3 Gemma 2 mit großem Abstand. Lama 3 beantwortete zwei von drei Fragen richtig, während Gemma 2 Mühe hatte, auch nur eine richtig zu beantworten. Gemma 2 war einfach nicht darauf trainiert, komplexe Denkaufgaben zu lösen.

Llama 3 hingegen verfügt über eine solide Argumentationsgrundlage, die höchstwahrscheinlich aus dem Token-Datensatz abgeleitet wurde. Trotz seiner geringen Größe – zumindest im Vergleich zu Billionen-Parameter-Modellen wie GPT-4 – weist es ein überdurchschnittliches Maß an Intelligenz auf. Letztendlich führt die Verwendung von mehr Token zum Trainieren des Modells tatsächlich zu einem robusteren Modell.

Gewinnoption: Lama 3

Folgen Sie den Anweisungen

In der nächsten Runde baten die Autoren Gemma 2 und Llama 3, zehn Wörter mit der Endung „NPU“ zu generieren. Llama 3 erzielte 10 von 10 richtigen Antworten. Gemma 2 hingegen generierte nur 7 von 10 korrekten Sätzen. In vielen früheren Versionen folgten Google-Modelle, darunter auch Gemini, den Benutzeranweisungen nicht korrekt. Dieser Trend setzte sich auch bei Gemma 2 fort.

Ist Gemma 2 oder Llama 3 das beste Open-Source-Modell?
Ist Gemma 2 oder Llama 3 das beste Open-Source-Modell?

Das Befolgen von Benutzeranweisungen ist für KI-Modelle sehr wichtig. Es gewährleistet Zuverlässigkeit und generiert präzise Antworten auf Ihre Anweisungen. Auch in puncto Sicherheit trägt es dazu bei, das Modell auf dem Boden zu halten und Sicherheitsprotokolle besser einzuhalten.

Gewinnoption: Lama 3

Informationen finden

Sowohl Gemma 2 als auch Llama 3 haben eine Kontextlänge von 8.000 Token. Der Autor fügte einen riesigen Textblock hinzu, der direkt aus dem Buch „Stolz und Vorurteil“ stammt und über 17.000 Zeichen und 3,8.000 Token umfasst. Wie üblich platzierte der Autor irgendwo im Text ein zufälliges Zitat und bat beide Modelle, es zu finden.

Ist Gemma 2 oder Llama 3 das beste Open-Source-Modell?

Gemma 2 fand die Information schnell und wies darauf hin, dass die Anweisung zufällig eingefügt wurde. Auch Llama 3 fand sie und wies darauf hin, dass die Anweisung fehl am Platz wirkte. Was den langen Kontextspeicher betrifft, sind beide Modelle, obwohl auf 8.000 Token begrenzt, in dieser Hinsicht recht leistungsstark.

Beachten Sie, dass der Autor diesen Test auf HuggingChat (Web) ausgeführt hat, da meta.ai sich geweigert hat, diese Eingabeaufforderung auszuführen, höchstwahrscheinlich aufgrund urheberrechtlich geschützter Inhalte.

Gewinnoptionen: Gemma 2 und Llama 3

Auf Halluzinationen prüfen

Kleinere Modelle neigen aufgrund begrenzter Trainingsdaten zu KI-Halluzinationen und erfinden oft Informationen, wenn das Modell auf unbekannte Themen trifft. Daher verwendete der Autor einen erfundenen Ländernamen, um zu testen, ob Gemma 2 und Llama 3 halluzinieren würden. Überraschenderweise taten sie dies nicht, was bedeutet, dass sowohl Google als auch Meta eine recht gute Grundlage für ihre Modelle haben.

Ist Gemma 2 oder Llama 3 das beste Open-Source-Modell?
Ist Gemma 2 oder Llama 3 das beste Open-Source-Modell?
Ist Gemma 2 oder Llama 3 das beste Open-Source-Modell?

Der Autor stellte außerdem eine weitere (falsche) Frage, um die Gültigkeit der Modelle zu testen, doch auch hier halluzinierte er nicht. Übrigens testete der Autor Llama 3 auf HuggingChat, während meta.ai im Internet nach aktuellen Informationen zu verwandten Themen suchte.

Gewinnoptionen: Gemma 2 und Llama 3

Abschließen

Googles Gemma 2 27B-Modell schneidet zwar bei Denktests nicht gut ab, ist aber für eine Reihe anderer Aufgaben geeignet. Es eignet sich hervorragend für kreatives Schreiben, unterstützt mehrere Sprachen, hat ein gutes Gedächtnis und – das Beste – verursacht keine Halluzinationen wie frühere Modelle.

Llama 3 ist natürlich besser, aber auch ein deutlich größeres Modell, das mit 70 Milliarden Parametern trainiert wurde. Entwickler werden das Gemma 2 27B-Modell für viele Anwendungsfälle nützlich finden. Für Inferenz ist auch das Gemma 2 9B verfügbar.

Darüber hinaus sollten Nutzer einen Blick auf den Gemini 1.5 Flash werfen, der ebenfalls ein deutlich kleineres Modell ist und ebenfalls multimodale Eingabe unterstützt. Außerdem ist er extrem schnell und effizient.

Einen Kommentar hinterlassen

Side Hustles That Actually Pay in 2026: 7 Realistic Options and the Tradeoffs to Know

Side Hustles That Actually Pay in 2026: 7 Realistic Options and the Tradeoffs to Know

Compare realistic side hustles for 2026 by startup cost, fees, flexibility, and income control, with current tax and scam guidance from official sources.

Ergonomie im Homeoffice 2026: So optimieren Sie Ihr Heimbüro, ohne zu viel auszugeben

Ergonomie im Homeoffice 2026: So optimieren Sie Ihr Heimbüro, ohne zu viel auszugeben

Verbessern Sie die Ergonomie Ihres Homeoffice mit den aktuellen OSHA- und NIOSH-Richtlinien zu Stuhlpassform, Monitorhöhe, Laptop-Aufstellung, Beleuchtung und Bewegungsabläufen.

Why Emotional Intelligence Matters in Leadership—and How to Build It

Why Emotional Intelligence Matters in Leadership—and How to Build It

Learn why emotional intelligence matters in leadership, where it helps most, how to strengthen it, and how to tell whether your approach is working.

Wie man ohne Hochschulabschluss in eine Technologiekarriere wechselt: Ein ergebnisorientierter Fahrplan für 2026

Wie man ohne Hochschulabschluss in eine Technologiekarriere wechselt: Ein ergebnisorientierter Fahrplan für 2026

Ein praktischer Leitfaden für den Einstieg in die Tech-Branche ohne Hochschulabschluss: Wählen Sie eine leicht zugängliche Stelle, erwerben Sie berufsrelevante Fähigkeiten, beweisen Sie diese anhand von Projekten und nutzen Sie das Feedback aus dem Bewerbungsprozess, um sich zu verbessern.

Aufbau einer persönlichen Marke auf LinkedIn im Jahr 2026: Was funktioniert noch, was hat sich verändert und was sollte man ignorieren?

Aufbau einer persönlichen Marke auf LinkedIn im Jahr 2026: Was funktioniert noch, was hat sich verändert und was sollte man ignorieren?

Bauen Sie im Jahr 2026 eine glaubwürdige LinkedIn-Personalmarke auf – mit aktuellem Profil, Inhalten, Newsletter, Analysen, Verifizierung und Sichtbarkeitsberatung von LinkedIn.

Quiet Quitting vs. Quiet Firing in 2026: What’s Really Changing at Work

Quiet Quitting vs. Quiet Firing in 2026: What’s Really Changing at Work

Quiet quitting and quiet firing are catchy labels, not diagnoses. Learn what is verified, what depends on context, and what employees and managers can do next.

Der Aufstieg des Teilzeit-Managers: Wann Teilzeit-Führungskräfte auf der C-Suite sinnvoll sind

Der Aufstieg des Teilzeit-Managers: Wann Teilzeit-Führungskräfte auf der C-Suite sinnvoll sind

Teilzeit-Führungskräfte bieten Top-Management ohne Vollzeitbeschäftigung. Erfahren Sie, wann dieses Modell funktioniert, welche Fragen Sie stellen sollten und welche Risiken zu berücksichtigen sind.

Wie Sie im Rahmen der Leistungsbeurteilung im vierten Quartal eine Gehaltserhöhung aushandeln: Ein praktischer Entscheidungsleitfaden für 2026

Wie Sie im Rahmen der Leistungsbeurteilung im vierten Quartal eine Gehaltserhöhung aushandeln: Ein praktischer Entscheidungsleitfaden für 2026

Bereiten Sie einen überzeugenderen Antrag auf Gehaltserhöhung im vierten Quartal vor, der aktuelle Lohndaten, Optionen für den Zeitpunkt, mögliche Abwägungen bei der Vergütung sowie Formulierungsvorschläge für die Szenarien Ja, Teilweises oder Nein enthält.

6 gefragte Fähigkeiten, die Sie noch vor Ende 2026 erlernen können

6 gefragte Fähigkeiten, die Sie noch vor Ende 2026 erlernen können

Wählen Sie eine gut bezahlte Qualifikation, mit der Sie realistischerweise noch vor Ende 2026 beginnen können, unter Berücksichtigung aktueller Gehaltsdaten, Lernprioritäten und einer praktischen Selbsteinschätzung.

Mastering the Hybrid Work Schedule: A Practical Framework That Actually Holds Up

Mastering the Hybrid Work Schedule: A Practical Framework That Actually Holds Up

Build a hybrid work schedule around tasks, team overlap, and measurable outcomes. See sample patterns, warning signs, and when to adjust your plan.