peonist-ai/halogen-flash-server

AMD Strix Halo向けに特化した、Qwen3.8-Flash-Nextを最速で動かすOpenAI互換LLM推論サーバーです。

インストール型ツール要確認 · NOASSERTIONLLM ツール・RAGShell難易度
345+0今週0
24フォーク18Issue
デモ・公式サイトをひらくhuggingface.co

中辛 の解説

Podmanコンテナ1コマンドで起動でき、モデルウェイト(118 GiB)は初回起動時に自動ダウンロードされます。OpenAI Chat CompletionsとResponses の両方に対応しており、OpenAI Codex や各種エージェントクライアントをそのまま接続できます。投機的デコード(draft headとprompt lookup)により高速な生成を実現しており、temperature=0ではシリアルなgreedy decodeとバイト単位で同一の出力を保証します。ビジョン機能・ロングコンテキスト(最大1M)・reasoning_effort制御にも対応し、設定は環境変数で調整できます。ただしAMD Strix Halo(gfx1151)専用であり、他のGPUでは動作しません。

こんなリポジトリです

こんなときに便利です

  • AMD Strix HaloマシンでQwen3モデルをローカル推論サーバーとして運用したい場合
  • OpenAI Codex CLIや既存のOpenAI互換クライアントをローカルLLMに接続したい場合
  • 長いコンテキスト(32K〜1M)を扱うエージェントワークロードを高速に処理したい場合

主な機能

gfx1151専用カーネルによる高速prefill(32Kで23秒)draft head・prompt lookupを組み合わせた投機的デコードOpenAI Chat Completions・Responses API両対応

ほかとの違い

汎用推論エンジンと異なり、AMD Strix Halo(gfx1151)とQwen3モデルファミリーに特化したカーネルを実装することで、同一ハードウェア上の競合実装と比べてエンドツーエンドで約4倍高速なprefillを実現しています。

食べた人たち

実際に使ってみた人の記録です — 一言も完走の記録も、確認のうえで公開しています。

試食評 · 使った人のひとこと

まだ試食評がありません。使ってみたら、最初のひとことをどうぞ。

ほかのリポジトリの試食評を見る →

このリポジトリで作られたもの

🖋 完走を記録する

まだ完走の記録がありません。最初の一膳を記録してみませんか。

このリポジトリの作り方

はじめてですか? むずかしくありません — 上から順にたどれば、自分の環境で動かして味見できます。

準備するもの

  • AMD Strix Halo(gfx1151)搭載GPU
  • ROCm対応環境
  • PodmanまたはDocker
  • 空き容量約120 GiB以上(ウェイト保存用)

すぐ動かしてみるDocker Compose

ギット飯がリポジトリの構成を確認して組み立てた実行コマンドです。ターミナルに貼り付ければ、取得から実行までまとめて進みます。

git clone --depth 1 https://github.com/peonist-ai/halogen-flash-server.git &&
cd halogen-flash-server &&
docker compose up

Docker が必要です — Mac なら OrbStack(brew install --cask orbstack)がおすすめです。

コードは自分の環境で動きます — はじめて見るリポジトリなら、中身にひととおり目を通してから実行するのがおすすめです。

README の詳しい手順を見る
  1. ウェイトを自動ダウンロードしながらサーバーを起動する(初回は118 GiBのダウンロードが発生します)
podman run --rm -p 8731:8731 \
  --device /dev/kfd --device /dev/dri --group-add keep-groups \
  --ipc=host --ulimit memlock=-1:-1 \
  -e HALOGEN_DOWNLOAD=peonist-ai/halogen-qwen3.8-flash-next \
  -v ~/halogen-models:/models \
  ghcr.io/peonist-ai/halogen-flash-server:0.6.2
  1. (任意) ウェイトを手動でダウンロードしてからサーバーを起動する場合
hf download peonist-ai/halogen-qwen3.8-flash-next --local-dir ~/halogen-models

podman run --rm -p 8731:8731 \
  --device /dev/kfd --device /dev/dri --group-add keep-groups \
  --ipc=host --ulimit memlock=-1:-1 \
  -v ~/halogen-models:/models:ro \
  ghcr.io/peonist-ai/halogen-flash-server:0.6.2

ギット飯トライで味見

入れるのが面倒で少し不安だったなら — 安全スキャンからインストールまで、ターミナル一行で終わります。

ターミナルに貼り付ければ、ギット飯の安全スキャン → 隔離フォルダへ clone → インストール → 実行方法の案内まで自動です。はじめてでも大丈夫 — この一行だけです。

npx gitbap-try peonist-ai/halogen-flash-server

Node.js さえあれば、インストールなしで動きます · ギット飯トライとは? →

スター推移 · 7日

345+0 / 7日

使いやすさ · まねしやすいか

サンプル評点 14/100
  • ゆるいライセンス
  • テストあり
  • サンプル集
  • 最近の更新
  • AGENTS.md
  • llms.txt
  • テンプレート

最近の更新あり · 2026 年に作成

「LLM ツール・RAG」 こういうリポジトリを毎週受け取りませんか?

毎週月曜の朝、選んだ一膳だけ。広告なし · いつでも解除。

自分のリポジトリですか? README にギット飯バッジを貼る
[![깃밥](https://www.gitbap.com/badge/peonist-ai/halogen-flash-server.svg)](https://www.gitbap.com/r/peonist-ai/halogen-flash-server)
Claude からそのまま使う — ギット飯のつなぎ方

ギット飯を Claude につなぐと、こうしたリポジトリを Claude・Cursor・Codex から直接さがして試せます。

方法 ① コネクタ URL

Claude の設定 → コネクタにこのアドレスを貼り付け。

https://www.gitbap.com/api/mcp
方法 ② プラグイン(試用まで)

プラグインを入れると /gitbap-trending·/gitbap-try のスラッシュコマンドで、その場でリポジトリを試せます。Claude Code で下の 2 行を順に実行してください。

/plugin marketplace add jakeparkcolde/gitbap-cowork
/plugin install gitbap-cowork@gitbap
つなぎ方をくわしく →

AI が README をもとに要約しました · 原文を見る