StayLameBro/backburner

MacBook と iPhone を USB-C で接続して Qwen 27B を実行し、プリフィル速度 44% 向上・19 万トークンのコンテキストに対応するローカル LLM エンジン

インストール型ツール自由に使える · MITモバイルPython難易度
9050 保存
91フォーク5Issue

中辛 の解説

MacBook と iPhone の GPU・Neural Engine を活用して大規模言語モデル推論を高速化するツールです。Mac が下位層を GPU で、iPhone が上位層を GPU で並列処理するスプリット・プリフィルと、Mac の KV キャッシュ容量を超えた古いキーを iPhone に保持させるハイブリッド方式で、単体 Mac では困難な長いコンテキスト(最大 19 万トークン)と高速なプリフィル(16k-48k で 29-44% 改善)の両立を実現します。llama.cpp フォークに Metal・SME2・DFlash2 などの最適化カーネルを加え、quantize モデル(Qwen3.8-27B IQ4_XS)をロードして scripts/serve.sh で起動するだけで OpenAI 互換 API を提供します。測定は M4 Pro 24GB + iPhone 17 Pro Max で検証済みです。ただし iPhone 必須のため、Mac 単体では使えません。

こんなリポジトリです

こんなときに便利です

  • AI エージェントの長いコンテキスト対応:ファイル・ツール結果を大量に読み込む際のプリフィル遅延を 30-40% 削減
  • コンテキスト窓の拡張:単体 Mac では容量不足の 19 万トークント以上を iPhone と共有して対応
  • 推論速度の向上:M4 CPU SME ユニットと iPhone GPU を同時活用し、Mac 単体比で複合ワークロード(プリフィル+デコード)を高速化

主な機能

スプリット・プリフィル:Mac と iPhone が層を並列処理して読み込み速度を 44% 改善リモート KV キャッシュ:64k 超過分の古いキーを iPhone に保持し、最大 19 万トークント対応OpenAI 互換 API:scripts/serve.sh で HTTP サーバーを起動、既存 LLM クライアントで即利用可能

ほかとの違い

Apple Silicon の GPU・Neural Engine・CPU SME ユニットを同期オフロード可能にし、USB-C パイプラインを活用して単体 Mac では不可能な長コンテキスト+高速推論を両立させた点。

このリポジトリの作り方

はじめてですか? むずかしくありません — 上から順にたどれば、自分の環境で動かして味見できます。

準備するもの

  • Apple Silicon Mac(検証済み:M4 Pro 24GB)
  • iPhone 15 Pro 以降(検証済み:iPhone 17 Pro Max、iPhone 16 Pro Max)
  • 10 Gb/s USB-C ケーブル(付属ケーブルは USB 2 で不可)
  • Xcode または llama.cpp ビルド環境
  • huggingface-cli と coremltools

すぐに始める

  1. リポジトリをクローン
git clone --recursive https://github.com/StayLameBro/backburner && cd backburner
  1. Mac エンジンをビルド
cmake -S llama.cpp -B llama.cpp/build-metal -DCMAKE_BUILD_TYPE=Release
cmake --build llama.cpp/build-metal --target llama-server llama-quantize -j
  1. モデルダウンロード(Qwen3.8-27B と draft モデル)
huggingface-cli download z-lab/Qwen3.8-27B-DFlash2 --local-dir ~/Models/qwen38-27b-dflash2
scripts/make-drafter.sh ~/Models/qwen38-27b-dflash2 ~/Models/dflash2-v2-q4km-self16.gguf
  1. iPhone の半分のモデルを作成・転送
python3 scripts/split-gguf.py ~/Models/Qwen3.8-27B-IQ4_XS.gguf ~/Models/tail-iq4xs-L40-nohead.gguf -L 40 --no-head
scripts/phone-tail.sh L40
backburner phone
  1. macOS GPU 固定化(再起動後に毎回実行)
sudo sysctl iogpu.wired_limit_mb=20480
  1. サーバー起動
scripts/serve.sh

ギット飯トライで味見

入れるのが面倒で少し不安だったなら — 安全スキャンからインストールまで、ターミナル一行で終わります。

ターミナルに貼り付ければ、ギット飯の安全スキャン → 隔離フォルダへ clone → インストール → 実行方法の案内まで自動です。はじめてでも大丈夫 — この一行だけです。

npx gitbap-try StayLameBro/backburner

Node.js さえあれば、インストールなしで動きます · ギット飯トライとは? →

スター推移 · 7日

9057日間の増加数を計算するための比較データが不足しています

確認日時

使いやすさ · まねしやすいか

まねしやすいサンプル評点 52/100
  • ゆるいライセンス
  • テストあり
  • サンプル集
  • 最近の更新
  • AGENTS.md
  • llms.txt
  • テンプレート

最近の更新あり · 2026 年に作成

「モバイル」 こういうリポジトリを毎週受け取りませんか?

毎週月曜の朝、選んだ一膳だけ。広告なし · いつでも解除。

自分のリポジトリですか? README にギット飯バッジを貼る
[![깃밥](https://www.gitbap.com/badge/StayLameBro/backburner.svg)](https://www.gitbap.com/r/StayLameBro/backburner)
Claude からそのまま使う — ギット飯のつなぎ方

ギット飯を Claude につなぐと、こうしたリポジトリを Claude・Cursor・Codex から直接さがして試せます。

方法 ① コネクタ URL

Claude の設定 → コネクタにこのアドレスを貼り付け。

https://www.gitbap.com/api/mcp
方法 ② プラグイン(試用まで)

プラグインを入れると /gitbap-trending·/gitbap-try のスラッシュコマンドで、その場でリポジトリを試せます。Claude Code で下の 2 行を順に実行してください。

/plugin marketplace add jakeparkcolde/gitbap-cowork
/plugin install gitbap-cowork@gitbap
つなぎ方をくわしく →

AI が README をもとに要約しました · 原文を見る