ByteDance trainiert KI-Modell, das 10 Bio. Parameter erreichen könnte
Das Modell in einem frühen Stadium wäre laut Ars Technica deutlich größer als Moonshots Kimi K3.
Warum es wichtig ist
Der berichtete Vorstoß deutet darauf hin, dass chinesische KI-Unternehmen weiter an sehr großen Frontier-Modellen arbeiten, um den Abstand zu führenden US-Laboren zu verringern. Sollte das Modell veröffentlicht werden, würde es Moonshots Kimi K3 übertreffen, das als bislang größtes veröffentlichtes chinesisches Modell beschrieben wird.
Die Kernpunkte
- 1.ByteDance soll sich im Pre-Training eines sehr großen KI-Modells befinden.
- 2.Das Modell könnte bis zu 10 Billionen Parameter erreichen.
- 3.Genaue Größe und Veröffentlichungszeitpunkt stehen noch nicht fest.
ByteDance trainiert ein KI-Modell, das der Größe von Anthropics fortschrittlichstem Mythos-System nahekommen könnte, berichtete Ars Technica unter Berufung auf drei mit der Angelegenheit vertraute Personen. Das Modell befindet sich in einer frühen Pre-Training-Phase und könnte bis zu 10 Billionen Parameter haben; seine genaue Größe soll jedoch erst später festgelegt werden. Eine Quelle sagte, Pre-Training dauere typischerweise drei bis sechs Monate, bevor Fine-Tuning und Veröffentlichung folgen, sofern die Entwicklung erfolgreich verläuft.
⚡ Heute ausprobieren
Warten Sie ByteDances konkrete Veröffentlichungsdetails ab, bevor Sie Anbieter- oder Architekturentscheidungen auf Basis von Angaben zur Modellgröße treffen.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Modelle
OpenAI bringt neues für Cybersecurity trainiertes KI-Modell auf den Markt
Das Unternehmen baut sein Cybersecurity-Abwehrprogramm Daybreak mit einem neuen Modell aus.
Meta richtet KI-Strategie neu auf Open-Weight-Modelle aus
Meta hat Muse Glimmer vorgestellt und will die Gewichte von Muse Spark 1.2 in den kommenden Wochen öffnen.
Meta veröffentlicht Muse Glimmer für lokale Agenten-Workflows
Das offene 30B-Modell zielt auf On-Device-Agenten mit multimodaler Eingabe und 4-Bit-Quantisierung.