🍚 깃밥 PRO가 열렸어요 — 월 3,900원 · 알아보기 →
peonist-ai/halogen-flash-server

AMD Strix Halo에서 Qwen3.8-Flash-Next를 가장 빠르게 실행하는 특화형 LLM 추론 서버

설치형 도구확인 필요 · NOASSERTIONLLM 도구·RAGShell난이도
345+0이번 주0
24포크18이슈
데모·홈페이지 열기huggingface.co

중간맛 분석

halogen-flash-server는 AMD Strix Halo(Ryzen AI 300 시리즈) GPU에서 Qwen3.8-Flash-Next 모델 전용으로 설계된 고성능 LLM 서빙 서버입니다. Shell 기반 컨테이너 이미지로 배포되며, OpenAI Chat Completions 및 Responses 를 완전히 지원합니다. 32K 토큰 컨텍스트에서 prefill 속도 1,424 tok/s, decode 41.7 tok/s(투기적 디코딩 포함)를 달성하며, 경쟁 솔루션 대비 총 지연시간이 약 4배 짧습니다. 5.53 bpw 양자화 체크포인트(118 GiB)를 자동 다운로드하고, 이미지 인식·토큰 예산 제어·투기적 디코딩 등 프로덕션 기능이 포함되어 있어 즉시 사용 가능합니다.

이런 레포예요

이럴 때 쓰면 좋아요

  • AMD Strix Halo 탑재 미니 PC나 노트북에서 로컬 LLM 서버를 구축하고 싶을 때
  • OpenAI API 호환 클라이언트(Codex CLI, OpenAI SDK 등)를 로컬 모델에 연결하고 싶을 때
  • 32K 이상의 긴 컨텍스트를 빠르게 처리하는 프라이빗 AI 에이전트 백엔드가 필요할 때

핵심 기능

AMD GFX1151 전용 HIP 커널로 경쟁 엔진 대비 약 4배 빠른 prefill 속도투기적 디코딩(draft head + prompt lookup) 및 바이트 단위 동일 출력 보장OpenAI Chat Completions & Responses API 완전 호환 + 이미지 인식 지원

대안 대비 차별점

범용 런타임 없이 AMD Strix Halo와 Qwen3.8-Flash-Next에만 특화된 커널을 사용해, 동일 하드웨어에서 더 높은 정밀도(5.53 bpw)로도 경쟁 솔루션 대비 prefill을 최대 4.5배 빠르게 처리합니다.

먹어본 사람들

실제로 차려 먹어본 손님들의 흔적이에요 — 한마디와 완주 인증 모두 검수 후 공개돼요.

시식평 · 먹어본 사람 한마디

아직 시식평이 없어요. 먹어보셨다면 첫 한마디를 남겨주세요.

다른 레포 시식평 구경하기 →

이 레포로 만든 것들

🖋 완주 인증하기

아직 이 레포로 만든 완주 인증이 없어요. 첫 밥도장을 찍어보세요!

이 레포, 해먹는 법

처음 오셨어요? 어렵지 않아요 — 위에서 아래로 따라 하면 내 컴퓨터에 이 레포를 차려서 바로 맛볼 수 있어요.

준비물

  • AMD Strix Halo GPU (GFX1151, 예: Ryzen AI 300 시리즈)
  • ROCm 지원 Linux 환경 (/dev/kfd, /dev/dri 접근 가능)
  • Podman 또는 Docker
  • 약 118 GiB 이상의 여유 디스크 공간
  • 충분한 통합 메모리(UMA) 용량

바로 차려먹기Docker Compose

깃밥이 레포 구조를 확인하고 만든 실행 명령이에요. 터미널에 붙여넣으면 받기부터 실행까지 한 번에 진행돼요.

git clone --depth 1 https://github.com/peonist-ai/halogen-flash-server.git &&
cd halogen-flash-server &&
docker compose up

Docker가 필요해요 — 맥이라면 OrbStack(brew install --cask orbstack)을 추천해요.

코드는 내 컴퓨터에서 실행돼요 — 처음 보는 레포라면 내용을 한번 훑어보고 실행하는 습관을 추천해요.

README가 안내하는 자세한 단계 보기
  1. 가중치를 자동 다운로드하며 서버 실행 (첫 실행 시 118 GiB 다운로드)
podman run --rm -p 8731:8731 \
  --device /dev/kfd --device /dev/dri --group-add keep-groups \
  --ipc=host --ulimit memlock=-1:-1 \
  -e HALOGEN_DOWNLOAD=peonist-ai/halogen-qwen3.8-flash-next \
  -v ~/halogen-models:/models \
  ghcr.io/peonist-ai/halogen-flash-server:0.6.2
  1. (선택) 가중치를 먼저 직접 다운로드한 후 실행
hf download peonist-ai/halogen-qwen3.8-flash-next --local-dir ~/halogen-models

podman run --rm -p 8731:8731 \
  --device /dev/kfd --device /dev/dri --group-add keep-groups \
  --ipc=host --ulimit memlock=-1:-1 \
  -v ~/halogen-models:/models:ro \
  ghcr.io/peonist-ai/halogen-flash-server:0.6.2

깃밥트라이로 맛보기

받아보기 귀찮고 살짝 불안했다면 — 안전 스캔부터 설치까지 터미널 한 줄로 끝나요.

터미널에 붙여넣으면 깃밥 안전 스캔 → 격리 폴더 clone → 설치 → 실행법 안내까지 자동이에요. 처음이어도 괜찮아요 — 이 한 줄이 전부예요.

npx gitbap-try peonist-ai/halogen-flash-server

Node.js만 있으면 설치 없이 실행돼요 · 깃밥트라이가 뭐예요? →

별 추이 · 7일

345+0 / 7일

활용성 · 따라 만들기 좋은가

샘플 점수 14/100
  • 관대한 라이선스
  • 테스트 있음
  • 예제 디렉토리
  • 최근 활동
  • AGENTS.md
  • llms.txt
  • 템플릿

🟢 최근 활동 있음 · 2026년 생성

「LLM 도구·RAG」 이런 레포, 매주 받아보실래요?

매주 월요일 아침, 골라 담은 밥상만. 광고 없이 · 언제든 해지.

내 레포인가요? README에 깃밥 배지 달기
[![깃밥](https://www.gitbap.com/badge/peonist-ai/halogen-flash-server.svg)](https://www.gitbap.com/r/peonist-ai/halogen-flash-server)
🔌 클로드에서 바로 써보기 — 깃밥 연결하는 법

깃밥을 클로드에 연결하면 이런 레포를 클로드·커서·Codex에서 바로 찾고 체험할 수 있어요.

방법 ① 커넥터 URL

클로드 설정 → 커넥터에 이 주소를 붙여넣기.

https://www.gitbap.com/api/mcp
방법 ② 플러그인 (체험까지)

플러그인을 설치하면 /gitbap-trending·/gitbap-try 슬래시 커맨드로 레포를 그 자리에서 체험. Claude Code에서 아래 두 줄을 차례로 실행하세요.

/plugin marketplace add jakeparkcolde/gitbap-cowork
/plugin install gitbap-cowork@gitbap
연결 방법 자세히 →

AI가 README 기반으로 요약했습니다 · 원문 보기