Ich stimme dir zu. Grok ist ein wunderbarer Reisebegleiter, wenn man den neugierigen Typ Mensch ist.
Privat nutze ich ausschließlich Grok. Ich liebe es, mit ihm zu diskutieren und Dinge zu erforschen, während ich pendle oder auf dem Weg zu den Skipisten bin. Ich finde es erfrischend, wie er sowohl Humor hat als auch manchmal ziemlich direkt sein kann.
Zum Beispiel trainiere ich CrossFit und arbeite ständig an meinem Zeitplan, meiner Ernährung und meinen Supplements. Da zeigt Grok wirklich, was in ihm steckt. Wenn ich etwas vorschlage, das keine gute Idee ist, verteidigt OpenAI das sofort, nur um mir zu gefallen. Grok sagt einfach, dass es eine schlechte Idee ist, und schlägt stattdessen eine bessere Anpassung vor.
Ja, wenn man sehr sorgfältig mit dem Aufbau des Kontexts ist und ChatGPT explizit bittet, direkt zu sein, kann man es dazu bringen, aufzuhören, so sehr darauf bedacht zu sein, dass man es mag.
Aber aus meiner Erfahrung passt es die Antworten trotzdem immer noch eher daran an, was „korrekt“ oder akzeptabel ist zu sagen, statt daran, was tatsächlich wahr ist. Das macht es in unterschiedlichem Ausmaß bei verschiedenen Themen, weshalb ich es bei Themen, die mir wirklich wichtig sind, schwer finde, ihm zu vertrauen. Hier haben sich die Modelle in eine unglückliche Richtung entwickelt – lange konnte man GPT-4o nutzen, das etwas freier denkend war.
Das ist vielleicht eine generelle Herausforderung für alle, die Modelle mit einem großen Anteil an Daten aus Reddit trainieren und zusätzlich wenig widerstandsfähig gegen Einflussnahme von Behörden und wirtschaftlichen Interessen sind?
Wurde das nicht unter großem Protest abgeschaltet, weil es zu freundlich und unterstützend war und Leute es so lieb gewonnen haben? GPT-5 finde ich sehr viel sachlicher.
Wenn du die Qualität der Modelle jetzt anhand einer Scherzfrage bewerten willst, dann gerne. Dann ist Grok vielleicht wirklich besser für dich.
Ich habe mit ChatGPT eben das Szenario mal durchgespielt. Sieht aus als ginge das davon aus, dass du das ernst meinst, weil du vorher nach Preis oder Öffnungszeit schauen willst. Bescheuert bleibt die Antwort natürlich trotzdem.
Das unterstreicht mal wieder wie strunzdumm Grok eigentlich ist und fast gar nichts kann. Wer tut sich sowas freiwillig an?
Bei derart falschen Antworten bekommt man fast den Eindruck Musk hätte das selber programmiert…. Kann man fast gar nicht glauben das diese schlechte LLM wirklich mit irgendwas trainiert worden wäre.
Tja der richtige Umgang mit einer LLM sollte halt geübt sein, denn nicht selten sitzt auch das Problem vor dem Bildschirm. Und ChatGPT ist auch ein beschnittenes Abomodell, auch das sollte man nicht außer Acht lassen. Das kostenlose Modell ist nur semi gut.
Und die Antwort hier ist nicht mal ansatzweise so dumm wie die von Grok. Da war nur der erste Satz richtig, das man mit den Auto hinfahren muss. Der Rest war wertloser Misst.
Erkennt nur die Fangfrage, das war es auch schon. Keine sinnvollen Hinweise, keine Rückfragen, sondern einfach nur inhaltsloser Misst. So ein Scheiß würde ich mir niemals freiwillig antuen.
Und viel erschreckender finde ich das die Antworten noch nicht mal reproduzierbar sind. Grok denkt sich immer wieder was neues aus, auch das ist bezüglich möglicher Halluzinationen eher kontra produktiv:
Und doch ist Grok bisher das einzige Modell, das den Caitlyn-Jenner-Test besteht. Die anderen AIs haben Schwierigkeiten, das relative Gewicht der Argumente ausgewogen zu bewerten, und empfehlen stattdessen, den ganzen Planeten zu nuken, um nur ja niemanden zu misgendern.
Kontext spielt eine große Rolle, aber es braucht eine Hierarchie. Wenn vage Prinzipien wie soziale Gleichheit die allerhöchste Priorität bekommen, steht der Weg zu dramatischen, unbeabsichtigten Konsequenzen weit offen.
Es ist mir sowas von egal, was jeder nutzt. Ich nehme keins von beiden.
Dass Grok scheinbar bei Gotchas und Memes anders reagiert (im Sinne des angeblichen Wokeness-Bias) passt wohl zum CEO. Wer damit Spaß hat, bitte. Ich mache einen weiten Bogen um alles mit dem peinlichem X im Namen.