🤖 LLM-Setup Watch — Modell- & llama.cpp-Report
Automatisch gepflegt von Hermes-Cronjobs (HF-Scan 09:00, llama.cpp-Report 12:00 Berlin).
Letzte Aktualisierung: 2026-09-01 10:02 UTC
📡 HF Neumodell-Scan
Ornith-1.5-35B-A3B-APEX-GGUF
- Hersteller: mudler
- Parameter (B): 34.7B
- llama.cpp: GGUF: Ornith-1.5-35B-A3B-APEX-I-Balanced.gguf (25.3GB); Ornith-1.5-35B-A3B-APEX-Balanced.gguf (25.3GB); Ornith-1.5-35B-A3B-APEX-I-Quality.gguf (22.8GB) +4 weitere | Arch: qwen35moe
- Besonderheiten: MoE, ctx 256K, Tool-Calling
- VRAM-Fit: größte GGUF 25.3GB → passt knapp (wenig KV-Headroom)
- Signal: 16♥ / 0 DL | Lizenz: apache-2.0 | seit 2026-08-20
- URL: https://huggingface.co/mudler/Ornith-1.5-35B-A3B-APEX-GGUF
Qwen3.8-27B-Unleashed-GGUF
- Hersteller: outsourc-e
- Parameter (B): ?
- llama.cpp: GGUF: Qwen3.8-27B-Unleashed-UD-Q6_K.gguf (22.1GB); Qwen3.8-27B-Unleashed-UD-Q5_K_M.gguf (19.8GB); Qwen3.8-27B-Unleashed-UD-Q4_K_M.gguf (16.5GB) +6 weitere
- Besonderheiten: Reasoning, 256K ctx
- VRAM-Fit: größte GGUF 22.1GB → passt knapp (wenig KV-Headroom)
- Signal: 16♥ / 0 DL | Lizenz: apache-2.0 | seit 2026-08-20
- URL: https://huggingface.co/outsourc-e/Qwen3.8-27B-Unleashed-GGUF
Ornith-1.5-9B-heretic-GGUF
- Hersteller: Thunder13240
- Parameter (B): 9.0B
- llama.cpp: GGUF: Ornith-1.5-9B-heretic-Q4_K_M.gguf (5.6GB); Ornith-1.5-9B-heretic-Q2_K.gguf (3.8GB); Ornith-1.5-9B-heretic-Q2_K_S.gguf (3.7GB) +6 weitere | Arch: qwen35
- Besonderheiten: Vision, ctx 256K, Reasoning, 1M ctx
- VRAM-Fit: größte GGUF 5.6GB → passt mit Headroom
- Signal: 1♥ / 0 DL | Lizenz: mit | seit 2026-08-20
- URL: https://huggingface.co/Thunder13240/Ornith-1.5-9B-heretic-GGUF
Darwin-Darwin-4B-Opus-x-gemma-4-E4B-it-The-D-08412-Q8_0
Ling-3.0-tiny-base-i1-GGUF
- Hersteller: mradermacher
- Parameter (B): 8.2B
- llama.cpp: GGUF: Ling-3.0-tiny-base.i1-Q6_K.gguf (6.8GB); Ling-3.0-tiny-base.i1-Q5_K_M.gguf (5.9GB); Ling-3.0-tiny-base.i1-Q5_K_S.gguf (5.7GB) +10 weitere | Arch: bailingmoe3
- Besonderheiten: MoE, ctx 256K
- VRAM-Fit: größte GGUF 6.8GB → passt mit Headroom
- Signal: 0♥ / 0 DL | Lizenz: mit | seit 2026-08-21
- URL: https://huggingface.co/mradermacher/Ling-3.0-tiny-base-i1-GGUF
qwen2.5-coder-1.5b-q4
- Hersteller: handxt
- Parameter (B): 1.5B
- llama.cpp: GGUF: qwen2.5-coder-1.5b.Q4_K_M.gguf (1.0GB) | Arch: qwen2
- Besonderheiten: –
- VRAM-Fit: größte GGUF 1.0GB → passt mit Headroom
- Signal: 0♥ / 0 DL | Lizenz: ? | seit 2026-08-21
- URL: https://huggingface.co/handxt/qwen2.5-coder-1.5b-q4
Ornith-1.5-9B-i1-GGUF
- Hersteller: mradermacher
- Parameter (B): 9.0B
- llama.cpp: GGUF: Ornith-1.5-9B.i1-Q6_K.gguf (7.4GB); Ornith-1.5-9B.i1-Q5_K_M.gguf (6.5GB); Ornith-1.5-9B.i1-Q5_K_S.gguf (6.3GB) +20 weitere | Arch: qwen35
- Besonderheiten: ctx 256K
- VRAM-Fit: größte GGUF 7.4GB → passt mit Headroom
- Signal: 0♥ / 0 DL | Lizenz: mit | seit 2026-08-21
- URL: https://huggingface.co/mradermacher/Ornith-1.5-9B-i1-GGUF
acquisition_generator_AS_confidence_numina_qwen7b
gatsby-qwen2.5-7b-gguf
- Hersteller: jiavon
- Parameter (B): 7.6B
- llama.cpp: GGUF: Qwen2.5-7B-Instruct.Q4_K_M.gguf (4.7GB); qwen2.5-7b-instruct.Q4_K_M.gguf (4.7GB) | Arch: Qwen2ForCausalLM
- Besonderheiten: ctx 32K
- VRAM-Fit: größte GGUF 4.7GB → passt mit Headroom
- Signal: 0♥ / 0 DL | Lizenz: ? | seit 2026-08-21
- URL: https://huggingface.co/jiavon/gatsby-qwen2.5-7b-gguf
🔄 Baseline-Updates
Keine neuen Quants/Drafts in den Baseline-Repos.
🆕 GGUF-Watch
Keine neuen GGUFs für getrackte Modelle.
👁️ mmproj-Verfügbarkeit
Keine Änderungen bei mmproj-Verfügbarkeit.
🔁 Nachfolger-Erkennung
Keine Nachfolger der Baseline-Familien gefunden.
📝 Preset-Snippets
Keine Preset-Snippets (keine neuen GGUF-Kandidaten).
⚙️ Preset-Änderungen (Repo)
Keine Änderungen an Preset-Dateien im Repo.
🦙 llama.cpp Report
📋 llama.cpp Daily Report — 2026-09-01
🔍 Kurzübersicht:
• 20 neue Commits in 24h, Schwerpunkt CUDA/Metal-Performance und Quantisierung
• CUDA: Flash-Attention-Smem-Tiles (XOR swizzle) und erweiterte MoE-Fusion — direkt relevant für die RTX 4090
• ROCm: Radix-Top-K für lange Zeilen — relevant für die RX 7900XTX
• KV-Cache-Wiederherstellung nicht-kontinuierlicher Zellen optimiert — vorteilhaft für agentische Nutzung
• Keine neuen Versionierungs-Tags, nur Build-Releases b10728–b10733
📦 Neue Releases/Tags:
• b10733, b10731, b10730, b10729, b10728: Automatische Nightly-Build-Releases der letzten 24h; keine neuen semantischen Tags (v0.x unverändert bei v0.3.0)
🆕 Neue Commits (letzte 24h):
• e4b9af00: CUDA: XOR-swizzle Flash-Attention K/V-Smem-FP16-Tiles (#25635) — 4090: Ja, schnellere FA-Pfade bei 24GB-Modellen mit langem Kontext
• 41ef91f7: CUDA: MoE-Fusion auf Speculative-Decoding erweitert, Glu-/Topk-Router-Fusion für mehrere Tokens (#25635-Familie) — 4090: Ja, deutlicher TG-Gewinn bei MoE-Modellen im Agentik-Betrieb
• f8dbcd61: ROCm: Radix-Top-K für lange Zeilen (#27466) — 7900XTX: Ja, schnelleres Sampling bei großen Vokabularen
• 2d8d612e: KV-Cache: Optimiertes Wiederherstellen nicht-kontinuierlicher Zellen (#27991) — Beide GPUs: Ja, beschleunigt Context-Rollbacks, wichtig für agentische Workflows
• 0eadefeb/09412af3: qwen4exp: Recurrent State Rollback + Indexer-Head-Optimierung (#28123/#28023) — Beide: Ja, wenn Qwen4-Experimental-Modelle genutzt werden; sonst neutral
• 1b89a43e: quantize: Row-Slab-Streaming gegen Thread-Starvation (#27830) — CPU-seitig: Neutral für 24GB-GPU-Betrieb, aber schnelleres Quantisieren großer Modelle
• 85c55223: AVX2: Schnelleres Prompt-Processing großer Batches für IQ-Modelle — Nur CPU: Nicht relevant für GPU-Betrieb
• 5d4a3be2/458681e1/2a74817f/ab0b3bd3/d5d993a0: Metal (fa-vec-Tunings M1/M1 Ultra, Top-K-Radix, quantisierte Concat, Metal-4-Tensor-API) — Nicht relevant (Apple-Silicon)
• 010be968/8e53fcef/a32af33d: OpenCL-Intel-Tuning, WebGPU-Crashfix, SYCL-Free-Memory — Nicht relevant (keine Intel-GPUs im Einsatz)
• 774ee0e2/234a6eba/518b7623/580e88d8: UI-Kopierfunktion für agentische Antworten, CI-Bumps, KleidiAI-Doku, unzip-Check — Nicht relevant für GPU-Setup
⚙️ Relevante neue Features:
• CUDA Flash-Attention XOR-Swizzle (e4b9af00): Optimierter K/V-Smem-Zugriff in FA-Kernen — Empfehlung: Ja (4090 profitiert bei langen Kontexten)
• CUDA MoE-Fusion inkl. Spec-Dec (41ef91f7): Router/Glu-Fusion jetzt auch bei mehreren Tokens und Speculative Decoding — Empfehlung: Ja (MoE-Modelle lokal agentisch betreiben)
• ROCm Radix-Top-K (f8dbcd61): Effizientes Top-K-Sampling für lange Zeilen unter ROCm — Empfehlung: Ja (7900XTX)
• KV-Cache-Restore-Optimierung (2d8d612e): Schnelleres Zurücksetzen/Wiederherstellen von Cache-Zellen — Empfehlung: Ja (agentische Nutzung mit Context-Rollbacks)
• qwen4exp State-Rollback (0eadefeb): Recurrent-State-Rollback für Qwen4-Experimental — Empfehlung: Nicht relevant, sofern keine Qwen4-Exp-Modelle im Einsatz
💡 Empfehlung:
llama.cpp auf beiden Systemen auf Build b10733 oder neuer aktualisieren — die CUDA-MoE-Fusion und Flash-Attention-Optimierungen bringen messbare TG-Gewinne auf der 4090, der ROCm-Top-K-Fix profitiert der 7900XTX. Vor dem Update Kurz-Benchmark der aktuell genutzten Modelle sichern, um die Verbesserung zu verifizieren.
🤖 LLM-Setup Watch — Modell- & llama.cpp-Report
📡 HF Neumodell-Scan
Ornith-1.5-35B-A3B-APEX-GGUF
Qwen3.8-27B-Unleashed-GGUF
Ornith-1.5-9B-heretic-GGUF
Darwin-Darwin-4B-Opus-x-gemma-4-E4B-it-The-D-08412-Q8_0
Ling-3.0-tiny-base-i1-GGUF
qwen2.5-coder-1.5b-q4
Ornith-1.5-9B-i1-GGUF
acquisition_generator_AS_confidence_numina_qwen7b
gatsby-qwen2.5-7b-gguf
🔄 Baseline-Updates
Keine neuen Quants/Drafts in den Baseline-Repos.
🆕 GGUF-Watch
Keine neuen GGUFs für getrackte Modelle.
👁️ mmproj-Verfügbarkeit
Keine Änderungen bei mmproj-Verfügbarkeit.
🔁 Nachfolger-Erkennung
Keine Nachfolger der Baseline-Familien gefunden.
📝 Preset-Snippets
Keine Preset-Snippets (keine neuen GGUF-Kandidaten).
⚙️ Preset-Änderungen (Repo)
Keine Änderungen an Preset-Dateien im Repo.
🦙 llama.cpp Report
📋 llama.cpp Daily Report — 2026-09-01
🔍 Kurzübersicht:
• 20 neue Commits in 24h, Schwerpunkt CUDA/Metal-Performance und Quantisierung
• CUDA: Flash-Attention-Smem-Tiles (XOR swizzle) und erweiterte MoE-Fusion — direkt relevant für die RTX 4090
• ROCm: Radix-Top-K für lange Zeilen — relevant für die RX 7900XTX
• KV-Cache-Wiederherstellung nicht-kontinuierlicher Zellen optimiert — vorteilhaft für agentische Nutzung
• Keine neuen Versionierungs-Tags, nur Build-Releases b10728–b10733
📦 Neue Releases/Tags:
• b10733, b10731, b10730, b10729, b10728: Automatische Nightly-Build-Releases der letzten 24h; keine neuen semantischen Tags (v0.x unverändert bei v0.3.0)
🆕 Neue Commits (letzte 24h):
• e4b9af00: CUDA: XOR-swizzle Flash-Attention K/V-Smem-FP16-Tiles (#25635) — 4090: Ja, schnellere FA-Pfade bei 24GB-Modellen mit langem Kontext
• 41ef91f7: CUDA: MoE-Fusion auf Speculative-Decoding erweitert, Glu-/Topk-Router-Fusion für mehrere Tokens (#25635-Familie) — 4090: Ja, deutlicher TG-Gewinn bei MoE-Modellen im Agentik-Betrieb
• f8dbcd61: ROCm: Radix-Top-K für lange Zeilen (#27466) — 7900XTX: Ja, schnelleres Sampling bei großen Vokabularen
• 2d8d612e: KV-Cache: Optimiertes Wiederherstellen nicht-kontinuierlicher Zellen (#27991) — Beide GPUs: Ja, beschleunigt Context-Rollbacks, wichtig für agentische Workflows
• 0eadefeb/09412af3: qwen4exp: Recurrent State Rollback + Indexer-Head-Optimierung (#28123/#28023) — Beide: Ja, wenn Qwen4-Experimental-Modelle genutzt werden; sonst neutral
• 1b89a43e: quantize: Row-Slab-Streaming gegen Thread-Starvation (#27830) — CPU-seitig: Neutral für 24GB-GPU-Betrieb, aber schnelleres Quantisieren großer Modelle
• 85c55223: AVX2: Schnelleres Prompt-Processing großer Batches für IQ-Modelle — Nur CPU: Nicht relevant für GPU-Betrieb
• 5d4a3be2/458681e1/2a74817f/ab0b3bd3/d5d993a0: Metal (fa-vec-Tunings M1/M1 Ultra, Top-K-Radix, quantisierte Concat, Metal-4-Tensor-API) — Nicht relevant (Apple-Silicon)
• 010be968/8e53fcef/a32af33d: OpenCL-Intel-Tuning, WebGPU-Crashfix, SYCL-Free-Memory — Nicht relevant (keine Intel-GPUs im Einsatz)
• 774ee0e2/234a6eba/518b7623/580e88d8: UI-Kopierfunktion für agentische Antworten, CI-Bumps, KleidiAI-Doku, unzip-Check — Nicht relevant für GPU-Setup
⚙️ Relevante neue Features:
• CUDA Flash-Attention XOR-Swizzle (e4b9af00): Optimierter K/V-Smem-Zugriff in FA-Kernen — Empfehlung: Ja (4090 profitiert bei langen Kontexten)
• CUDA MoE-Fusion inkl. Spec-Dec (41ef91f7): Router/Glu-Fusion jetzt auch bei mehreren Tokens und Speculative Decoding — Empfehlung: Ja (MoE-Modelle lokal agentisch betreiben)
• ROCm Radix-Top-K (f8dbcd61): Effizientes Top-K-Sampling für lange Zeilen unter ROCm — Empfehlung: Ja (7900XTX)
• KV-Cache-Restore-Optimierung (2d8d612e): Schnelleres Zurücksetzen/Wiederherstellen von Cache-Zellen — Empfehlung: Ja (agentische Nutzung mit Context-Rollbacks)
• qwen4exp State-Rollback (0eadefeb): Recurrent-State-Rollback für Qwen4-Experimental — Empfehlung: Nicht relevant, sofern keine Qwen4-Exp-Modelle im Einsatz
💡 Empfehlung:
llama.cpp auf beiden Systemen auf Build b10733 oder neuer aktualisieren — die CUDA-MoE-Fusion und Flash-Attention-Optimierungen bringen messbare TG-Gewinne auf der 4090, der ROCm-Top-K-Fix profitiert der 7900XTX. Vor dem Update Kurz-Benchmark der aktuell genutzten Modelle sichern, um die Verbesserung zu verifizieren.