lyogavin/airllm

低メモリGPUで超大規模言語モデルを実行するために、レイヤーごとの動的ストリーミングで推論メモリを劇的に削減するツールです。

優良食堂ギット飯が実際に動かして検証し、選んだリポジトリです解説ページへ →
インストール型ツール自由に使える · Apache-2.0AI メディア生成Jupyter Notebook難易度
35,391👀 120 保存
3,740フォーク110Issue

中辛 の解説

PyTorchベースのPythonライブラリで、AutoModel APIでHugging Face IDを指定するだけで利用開始できます。Qwen・Llama・DeepSeek・Mixtralなど主流モデルにほぼ対応し、4bit・8bitブロック単位量子化で最大3倍の推論高速化も可能です。Colabノートブックで即座に試せるサンプルが複数用意されており、MacOSでも動作します。難易度は中程度で、基本的なPythonとTransformersライブラリの知識があれば十分です。

こんなリポジトリです

こんなときに便利です

  • 限られたGPUメモリで大型言語モデルを運用したい場合
  • エッジデバイスやローカル環境でLLMを実行する必要があるとき
  • 複数の大規模モデルを同一ハードウェアで試し比べたいとき

主な機能

1層単位でのメモリロードによるVRAM削減ブロック単位の量子化で最大3倍の推論高速化Qwen・Llama・DeepSeek・Mixtralなど主流モデルへの自動対応

ほかとの違い

他の推論フレームワークとは異なり、層ごとの動的ストリーミング方式により、超大規模モデル (500B超) をスタンダードな消費者向けGPUで実行可能にしています。

このリポジトリの作り方

はじめてですか? むずかしくありません — 上から順にたどれば、自分の環境で動かして味見できます。

準備するもの

  • Python 3.8以上
  • PyTorchとTransformers
  • GPU (CUDA対応推奨、CPU対応あり)

すぐに始める

  1. airllmパッケージをインストールします。
pip install airllm
  1. モデルを読み込み、トークン化します。
from airllm import AutoModel

model = AutoModel.from_pretrained("Qwen/Qwen3-32B")
input_text = ['What is the capital of United States?']
input_tokens = model.tokenizer(input_text,
    return_tensors="pt",
    return_attention_mask=False,
    truncation=True,
    max_length=128,
    padding=False)
  1. テキスト生成を実行します。
generation_output = model.generate(
    input_tokens['input_ids'].cuda(),
    max_new_tokens=20,
    use_cache=True,
    return_dict_in_generate=True)

output = model.tokenizer.decode(generation_output.sequences[0])
print(output)

注:初回実行時にモデルが層ごとに分解・保存されるため、ディスク空き容量が十分必要です。

ギット飯トライで味見

入れるのが面倒で少し不安だったなら — 安全スキャンからインストールまで、ターミナル一行で終わります。

ターミナルに貼り付ければ、ギット飯の安全スキャン → 隔離フォルダへ clone → インストール → 実行方法の案内まで自動です。はじめてでも大丈夫 — この一行だけです。

npx gitbap-try lyogavin/airllm

Node.js さえあれば、インストールなしで動きます · ギット飯トライとは? →

スター推移 · 7日

35,3917日間の増加数を計算するための比較データが不足しています

確認日時

使いやすさ · まねしやすいか

まねしやすいサンプル評点 50/100
  • ゆるいライセンス
  • テストあり
  • サンプル集
  • 最近の更新
  • AGENTS.md
  • llms.txt
  • テンプレート

最近の更新あり · 2023 年に作成

「AI メディア生成」 こういうリポジトリを毎週受け取りませんか?

毎週月曜の朝、選んだ一膳だけ。広告なし · いつでも解除。

自分のリポジトリですか? README にギット飯バッジを貼る
[![깃밥](https://www.gitbap.com/badge/lyogavin/airllm.svg)](https://www.gitbap.com/r/lyogavin/airllm)
Claude からそのまま使う — ギット飯のつなぎ方

ギット飯を Claude につなぐと、こうしたリポジトリを Claude・Cursor・Codex から直接さがして試せます。

方法 ① コネクタ URL

Claude の設定 → コネクタにこのアドレスを貼り付け。

https://www.gitbap.com/api/mcp
方法 ② プラグイン(試用まで)

プラグインを入れると /gitbap-trending·/gitbap-try のスラッシュコマンドで、その場でリポジトリを試せます。Claude Code で下の 2 行を順に実行してください。

/plugin marketplace add jakeparkcolde/gitbap-cowork
/plugin install gitbap-cowork@gitbap
つなぎ方をくわしく →

AI が README をもとに要約しました · 原文を見る