Skip to content

🤖 LLM-Setup Watch — Modell- & llama.cpp-Report #4

Description

@tilloh-bot

🤖 LLM-Setup Watch — Modell- & llama.cpp-Report

Automatisch gepflegt von Hermes-Cronjobs (HF-Scan 09:00, llama.cpp-Report 12:00 Berlin).
Letzte Aktualisierung: 2026-09-01 10:02 UTC


📡 HF Neumodell-Scan

Ornith-1.5-35B-A3B-APEX-GGUF

  • Hersteller: mudler
  • Parameter (B): 34.7B
  • llama.cpp: GGUF: Ornith-1.5-35B-A3B-APEX-I-Balanced.gguf (25.3GB); Ornith-1.5-35B-A3B-APEX-Balanced.gguf (25.3GB); Ornith-1.5-35B-A3B-APEX-I-Quality.gguf (22.8GB) +4 weitere | Arch: qwen35moe
  • Besonderheiten: MoE, ctx 256K, Tool-Calling
  • VRAM-Fit: größte GGUF 25.3GB → passt knapp (wenig KV-Headroom)
  • Signal: 16♥ / 0 DL | Lizenz: apache-2.0 | seit 2026-08-20
  • URL: https://huggingface.co/mudler/Ornith-1.5-35B-A3B-APEX-GGUF

Qwen3.8-27B-Unleashed-GGUF

  • Hersteller: outsourc-e
  • Parameter (B): ?
  • llama.cpp: GGUF: Qwen3.8-27B-Unleashed-UD-Q6_K.gguf (22.1GB); Qwen3.8-27B-Unleashed-UD-Q5_K_M.gguf (19.8GB); Qwen3.8-27B-Unleashed-UD-Q4_K_M.gguf (16.5GB) +6 weitere
  • Besonderheiten: Reasoning, 256K ctx
  • VRAM-Fit: größte GGUF 22.1GB → passt knapp (wenig KV-Headroom)
  • Signal: 16♥ / 0 DL | Lizenz: apache-2.0 | seit 2026-08-20
  • URL: https://huggingface.co/outsourc-e/Qwen3.8-27B-Unleashed-GGUF

Ornith-1.5-9B-heretic-GGUF

  • Hersteller: Thunder13240
  • Parameter (B): 9.0B
  • llama.cpp: GGUF: Ornith-1.5-9B-heretic-Q4_K_M.gguf (5.6GB); Ornith-1.5-9B-heretic-Q2_K.gguf (3.8GB); Ornith-1.5-9B-heretic-Q2_K_S.gguf (3.7GB) +6 weitere | Arch: qwen35
  • Besonderheiten: Vision, ctx 256K, Reasoning, 1M ctx
  • VRAM-Fit: größte GGUF 5.6GB → passt mit Headroom
  • Signal: 1♥ / 0 DL | Lizenz: mit | seit 2026-08-20
  • URL: https://huggingface.co/Thunder13240/Ornith-1.5-9B-heretic-GGUF

Darwin-Darwin-4B-Opus-x-gemma-4-E4B-it-The-D-08412-Q8_0

Ling-3.0-tiny-base-i1-GGUF

  • Hersteller: mradermacher
  • Parameter (B): 8.2B
  • llama.cpp: GGUF: Ling-3.0-tiny-base.i1-Q6_K.gguf (6.8GB); Ling-3.0-tiny-base.i1-Q5_K_M.gguf (5.9GB); Ling-3.0-tiny-base.i1-Q5_K_S.gguf (5.7GB) +10 weitere | Arch: bailingmoe3
  • Besonderheiten: MoE, ctx 256K
  • VRAM-Fit: größte GGUF 6.8GB → passt mit Headroom
  • Signal: 0♥ / 0 DL | Lizenz: mit | seit 2026-08-21
  • URL: https://huggingface.co/mradermacher/Ling-3.0-tiny-base-i1-GGUF

qwen2.5-coder-1.5b-q4

  • Hersteller: handxt
  • Parameter (B): 1.5B
  • llama.cpp: GGUF: qwen2.5-coder-1.5b.Q4_K_M.gguf (1.0GB) | Arch: qwen2
  • Besonderheiten: –
  • VRAM-Fit: größte GGUF 1.0GB → passt mit Headroom
  • Signal: 0♥ / 0 DL | Lizenz: ? | seit 2026-08-21
  • URL: https://huggingface.co/handxt/qwen2.5-coder-1.5b-q4

Ornith-1.5-9B-i1-GGUF

  • Hersteller: mradermacher
  • Parameter (B): 9.0B
  • llama.cpp: GGUF: Ornith-1.5-9B.i1-Q6_K.gguf (7.4GB); Ornith-1.5-9B.i1-Q5_K_M.gguf (6.5GB); Ornith-1.5-9B.i1-Q5_K_S.gguf (6.3GB) +20 weitere | Arch: qwen35
  • Besonderheiten: ctx 256K
  • VRAM-Fit: größte GGUF 7.4GB → passt mit Headroom
  • Signal: 0♥ / 0 DL | Lizenz: mit | seit 2026-08-21
  • URL: https://huggingface.co/mradermacher/Ornith-1.5-9B-i1-GGUF

acquisition_generator_AS_confidence_numina_qwen7b

gatsby-qwen2.5-7b-gguf

  • Hersteller: jiavon
  • Parameter (B): 7.6B
  • llama.cpp: GGUF: Qwen2.5-7B-Instruct.Q4_K_M.gguf (4.7GB); qwen2.5-7b-instruct.Q4_K_M.gguf (4.7GB) | Arch: Qwen2ForCausalLM
  • Besonderheiten: ctx 32K
  • VRAM-Fit: größte GGUF 4.7GB → passt mit Headroom
  • Signal: 0♥ / 0 DL | Lizenz: ? | seit 2026-08-21
  • URL: https://huggingface.co/jiavon/gatsby-qwen2.5-7b-gguf

🔄 Baseline-Updates

Keine neuen Quants/Drafts in den Baseline-Repos.

🆕 GGUF-Watch

Keine neuen GGUFs für getrackte Modelle.

👁️ mmproj-Verfügbarkeit

Keine Änderungen bei mmproj-Verfügbarkeit.

🔁 Nachfolger-Erkennung

Keine Nachfolger der Baseline-Familien gefunden.

📝 Preset-Snippets

Keine Preset-Snippets (keine neuen GGUF-Kandidaten).

⚙️ Preset-Änderungen (Repo)

Keine Änderungen an Preset-Dateien im Repo.

🦙 llama.cpp Report

📋 llama.cpp Daily Report — 2026-09-01

🔍 Kurzübersicht:
• 20 neue Commits in 24h, Schwerpunkt CUDA/Metal-Performance und Quantisierung
• CUDA: Flash-Attention-Smem-Tiles (XOR swizzle) und erweiterte MoE-Fusion — direkt relevant für die RTX 4090
• ROCm: Radix-Top-K für lange Zeilen — relevant für die RX 7900XTX
• KV-Cache-Wiederherstellung nicht-kontinuierlicher Zellen optimiert — vorteilhaft für agentische Nutzung
• Keine neuen Versionierungs-Tags, nur Build-Releases b10728–b10733

📦 Neue Releases/Tags:
• b10733, b10731, b10730, b10729, b10728: Automatische Nightly-Build-Releases der letzten 24h; keine neuen semantischen Tags (v0.x unverändert bei v0.3.0)

🆕 Neue Commits (letzte 24h):
• e4b9af00: CUDA: XOR-swizzle Flash-Attention K/V-Smem-FP16-Tiles (#25635) — 4090: Ja, schnellere FA-Pfade bei 24GB-Modellen mit langem Kontext
• 41ef91f7: CUDA: MoE-Fusion auf Speculative-Decoding erweitert, Glu-/Topk-Router-Fusion für mehrere Tokens (#25635-Familie) — 4090: Ja, deutlicher TG-Gewinn bei MoE-Modellen im Agentik-Betrieb
• f8dbcd61: ROCm: Radix-Top-K für lange Zeilen (#27466) — 7900XTX: Ja, schnelleres Sampling bei großen Vokabularen
• 2d8d612e: KV-Cache: Optimiertes Wiederherstellen nicht-kontinuierlicher Zellen (#27991) — Beide GPUs: Ja, beschleunigt Context-Rollbacks, wichtig für agentische Workflows
• 0eadefeb/09412af3: qwen4exp: Recurrent State Rollback + Indexer-Head-Optimierung (#28123/#28023) — Beide: Ja, wenn Qwen4-Experimental-Modelle genutzt werden; sonst neutral
• 1b89a43e: quantize: Row-Slab-Streaming gegen Thread-Starvation (#27830) — CPU-seitig: Neutral für 24GB-GPU-Betrieb, aber schnelleres Quantisieren großer Modelle
• 85c55223: AVX2: Schnelleres Prompt-Processing großer Batches für IQ-Modelle — Nur CPU: Nicht relevant für GPU-Betrieb
• 5d4a3be2/458681e1/2a74817f/ab0b3bd3/d5d993a0: Metal (fa-vec-Tunings M1/M1 Ultra, Top-K-Radix, quantisierte Concat, Metal-4-Tensor-API) — Nicht relevant (Apple-Silicon)
• 010be968/8e53fcef/a32af33d: OpenCL-Intel-Tuning, WebGPU-Crashfix, SYCL-Free-Memory — Nicht relevant (keine Intel-GPUs im Einsatz)
• 774ee0e2/234a6eba/518b7623/580e88d8: UI-Kopierfunktion für agentische Antworten, CI-Bumps, KleidiAI-Doku, unzip-Check — Nicht relevant für GPU-Setup

⚙️ Relevante neue Features:
• CUDA Flash-Attention XOR-Swizzle (e4b9af00): Optimierter K/V-Smem-Zugriff in FA-Kernen — Empfehlung: Ja (4090 profitiert bei langen Kontexten)
• CUDA MoE-Fusion inkl. Spec-Dec (41ef91f7): Router/Glu-Fusion jetzt auch bei mehreren Tokens und Speculative Decoding — Empfehlung: Ja (MoE-Modelle lokal agentisch betreiben)
• ROCm Radix-Top-K (f8dbcd61): Effizientes Top-K-Sampling für lange Zeilen unter ROCm — Empfehlung: Ja (7900XTX)
• KV-Cache-Restore-Optimierung (2d8d612e): Schnelleres Zurücksetzen/Wiederherstellen von Cache-Zellen — Empfehlung: Ja (agentische Nutzung mit Context-Rollbacks)
• qwen4exp State-Rollback (0eadefeb): Recurrent-State-Rollback für Qwen4-Experimental — Empfehlung: Nicht relevant, sofern keine Qwen4-Exp-Modelle im Einsatz

💡 Empfehlung:
llama.cpp auf beiden Systemen auf Build b10733 oder neuer aktualisieren — die CUDA-MoE-Fusion und Flash-Attention-Optimierungen bringen messbare TG-Gewinne auf der 4090, der ROCm-Top-K-Fix profitiert der 7900XTX. Vor dem Update Kurz-Benchmark der aktuell genutzten Modelle sichern, um die Verbesserung zu verifizieren.

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions