AIアプリケーション別ハードウェア対照表 · MAQ選定ガイド

どのAIモデルを動かしたいですか、
最適な構成はどう選べばよいでしょうか。

gemma4-26bgpt-oss-120b、Qwen3、AI Agentワークフローまで——「モデル→VRAM→システムメモリ→CPU→推奨構成」を一覧化。各ニーズにMAQの実機種とオンライン見積もりが対応しており、VRAM数値はすべて量子化方式を明記しています。

オンライン見積もり → LINEで構成相談
MAQ AIワークステーション:OllamaとDockerをローカル実行するAIハードウェア環境
32GB
単一GPU 4-bit 26B
96GB
単一GPU gpt-oss-120B
4
GPUマルチカード構成
34Kから
AI Agent代理PC

この表の読み方

まずワークロードの種類(推論/ファインチューニング/画像生成/AI Agent)を確認し、次にモデルサイズに応じたVRAMシステムメモリを照合してください。右列はそのニーズに合わせてMAQが構成した機種で、そのままオンライン見積もりへ進めます。VRAMは量子化(4-bit/fp8/fp16)やコンテキスト長によって変動するため、表内の数値は保守的な見積もりです。

入門〜中型LLMのローカル推論(7B–32B)

このクラスは「1枚のカードで動かせる」ちょうど良い領域です。4-bit量子化で7B–14Bは約5–12GB、32Bは約18–24GBのVRAMが必要で、単体24–32GBのプロフェッショナルカードで快適に推論できます。重要なのはカードの大きさそのものではなく、「量子化後の重み+KVキャッシュ」(長いコンテキストは数GB単位で消費)をVRAMが賄えるかどうかです。全精度(FP16)にする、あるいはコンテキストを長くすると、必要量は2〜4倍に膨らみます。(モデルは2026年時点の主流バージョンを例示しており、同クラスの新バージョンでも必要なハードウェアはほぼ同等です。)

利用シーン · 代表的なモデル 推奨スペック 主な違い 推奨MAQ構成
デスクトップアシスタント/RAG質問応答の入門用途
Llama 3.1 8B · Gemma 3 12B · Qwen3 8B
5–12GB(4-bit);FP16:8B/9Bは約16–18GB、14Bは約28GB
32GB DDR5
12コア Ryzen 9(9900X3Dクラス)
4-bitであれば8B–14Bは余裕をもって動作し、24GBあれば8K–32Kコンテキスト分のKVキャッシュも確保できます。14Bの全精度運用や複数モデルの同時起動を行う場合は、32GBクラスの機種を直接ご検討ください。
AI-Eco(RTX PRO 4000 24GB)
約 10 萬
見積もり →
中規模の本番推論:gpt-oss-20bオンラインサービス
gpt-oss-20b · Qwen3 14B · Gemma 3 12B
16–24GB(gpt-oss-20bは量子化後約16GB、14BはQ8で約15GB)
64GB DDR5
12コア Ryzen 9 9900X3D
Ryzen 9 9900X3DとAMD Radeon AI PRO R9700 32GB GPUの組み合わせです。32GBのVRAMでgpt-oss-20bを完全にロードでき(AMDプラットフォームはROCm経由のFP8/量子化パスを使用、ネイティブMXFP4アクセラレーションはNVIDIA Blackwell機種限定)、並列処理と長いコンテキストにも余裕を残し、開梱してすぐに利用できます。
AI-Medium(AMD Radeon AI PRO R9700 32GB GPU、gpt-oss-20bプリロード済み)
約 16 萬
見積もり →
32Bクラスの高品質推論(コーディング支援/高度な質問応答)
Qwen3 32B · Gemma 3 27B
18–24GB(4-bit);Q8:Gemma 27Bは約27–30GB(単体32GBカードで動作可)、Qwen 32Bは約34–35GB(32GBをやや超過)
64GB DDR5
16コア Ryzen 9 9950X3D
4-bitであれば単体32GBカードでコンテキスト分の余裕を残して動作します。Gemma 27BはQ8でも収まりますが、Qwen 32BはQ8で32GBをわずかに超過するため、シーケンス長を短くするか48GBへの変更が必要です。AI-Medium(NT$151K/Radeon AI PRO R9700・ROCm)との違いは、NVIDIAのCUDAエコシステム、長時間稼働に安定したProドライバー、そしてGemmaのプリロードです。
AI-Medium-Gemma(RTX PRO 4500 32GB)
約 27 萬
見積もり →
デスクトップアシスタント/RAG質問応答の入門用途
約 10 萬
Llama 3.1 8B · Gemma 3 12B · Qwen3 8B
5–12GB(4-bit);FP16:8B/9Bは約16–18GB、14Bは約28GB
32GB DDR5・12コア Ryzen 9(9900X3Dクラス)
4-bitであれば8B–14Bは余裕をもって動作し、24GBあれば8K–32Kコンテキスト分のKVキャッシュも確保できます。14Bの全精度運用や複数モデルの同時起動を行う場合は、32GBクラスの機種を直接ご検討ください。
AI-Eco(RTX PRO 4000 24GB)
見積もり →
中規模の本番推論:gpt-oss-20bオンラインサービス
約 16 萬
gpt-oss-20b · Qwen3 14B · Gemma 3 12B
16–24GB(gpt-oss-20bは量子化後約16GB、14BはQ8で約15GB)
64GB DDR5・12コア Ryzen 9 9900X3D
Ryzen 9 9900X3DとAMD Radeon AI PRO R9700 32GB GPUの組み合わせです。32GBのVRAMでgpt-oss-20bを完全にロードでき(AMDプラットフォームはROCm経由のFP8/量子化パスを使用、ネイティブMXFP4アクセラレーションはNVIDIA Blackwell機種限定)、並列処理と長いコンテキストにも余裕を残し、開梱してすぐに利用できます。
AI-Medium(AMD Radeon AI PRO R9700 32GB GPU、gpt-oss-20bプリロード済み)
見積もり →
32Bクラスの高品質推論(コーディング支援/高度な質問応答)
約 27 萬
Qwen3 32B · Gemma 3 27B
18–24GB(4-bit);Q8:Gemma 27Bは約27–30GB(単体32GBカードで動作可)、Qwen 32Bは約34–35GB(32GBをやや超過)
64GB DDR5・16コア Ryzen 9 9950X3D
4-bitであれば単体32GBカードでコンテキスト分の余裕を残して動作します。Gemma 27BはQ8でも収まりますが、Qwen 32BはQ8で32GBをわずかに超過するため、シーケンス長を短くするか48GBへの変更が必要です。AI-Medium(NT$151K/Radeon AI PRO R9700・ROCm)との違いは、NVIDIAのCUDAエコシステム、長時間稼働に安定したProドライバー、そしてGemmaのプリロードです。
AI-Medium-Gemma(RTX PRO 4500 32GB)
見積もり →

大型LLMのローカル推論(70B–120B)

70BクラスのモデルはVRAMを4-bit量子化後で約43GB必要とし、単体48GBのプロフェッショナルカードで射程圏内に入ります。MAQのAI-HighはRTX PRO 5000 48GB版を採用しており、4-bitの70Bを動かした際の余裕は約5GBで、一般的な長さのコンテキストであれば十分です。同クラスのQwen3 72BはQ4で約47GBとなり上限に近づくため、長いコンテキストではより低い量子化(IQ4_XS)への変更が必要です。全精度運用、120B MoEモデル、あるいは長いコンテキストを余裕をもって動かすには、単体96GBカード、さらにはWRX90プラットフォームでの複数カードによるテンソル並列が必要になります。システムメモリは128GB以上、ECCを推奨し、長いコンテキストのKVキャッシュとCPUオフロードを支えます。

利用シーン · 代表的なモデル 推奨スペック 主な違い 推奨MAQ構成
ローカルで70B推論(4-bit、単体カードの入門構成)
Llama 3.3 70B(Qwen3 72Bクラスも同等)
Llama 70Bは約43GB(Q4_K_M、KVキャッシュ込み);72BクラスはQ4で約47GB、48GBカードで上限に近づく
128GB DDR5 ECC
24コア Threadripper 9960X
RTX PRO 5000 48GBの単体カードで4-bitのLlama 70B(約43GB)を動かせ、余裕は約5GB——一般的な長さのコンテキストであれば十分です。72BクラスのモデルはQ4で約47GBとなりVRAMをほぼ使い切るため、長いコンテキストにはIQ4_XSなどより低い量子化が必要です。長いコンテキストを余裕をもって扱いたい場合、全精度運用、あるいは高並列サービスを行う場合は、単体96GBカードまたは複数GPUへの変更をご検討ください。
AI-High(RTX PRO 5000 48GB)
約 61 萬
見積もり →
単体96GBカードでgpt-oss-120bを実行、モデル分割不要
gpt-oss-120b(MoE、MXFP4)/高精度70B
gpt-oss-120bの重みは約60GB(総パラメータ116.8B/アクティブ5.1B)、単体96GBカードならKVキャッシュにも十分な余裕
256GB DDR5 ECC
32コア Threadripper PRO 9975WX
RTX PRO 6000 96GBの単体カードだけでgpt-oss-120bを完全に搭載でき、複数カードへの分散は不要です。同じ96GBカードでほぼ全精度の70Bも動かせるため、構成が最もシンプルで、遅延も最小限に抑えられます。
AI-Highend(RTX PRO 6000 96GB)
約 120 萬
見積もり →
複数GPUによるテンソル並列:全精度70Bまたは分散120B
全精度Llama 70B(FP16で約140GB)/分散gpt-oss-120b
複数GPU合計で140GB以上;WRX90プラットフォームはネイティブに96GBカード4〜7枚の連結に対応
256GB DDR5 ECC(さらに拡張可能)
96コア Threadripper PRO 9995WX
全精度70B(FP16で約140GB)は単体カードには収まらず、複数GPUによるテンソル並列が必須です。WRX90のネイティブな4〜7カード構成は、全精度70Bまたは高並列の120Bサービスに適しており、GPU間の帯域幅が鍵となります。
AMD-WRX90(4〜7カード並列プラットフォーム)
約 152 萬
見積もり →
ローカルで70B推論(4-bit、単体カードの入門構成)
約 61 萬
Llama 3.3 70B(Qwen3 72Bクラスも同等)
Llama 70Bは約43GB(Q4_K_M、KVキャッシュ込み);72BクラスはQ4で約47GB、48GBカードで上限に近づく
128GB DDR5 ECC・24コア Threadripper 9960X
RTX PRO 5000 48GBの単体カードで4-bitのLlama 70B(約43GB)を動かせ、余裕は約5GB——一般的な長さのコンテキストであれば十分です。72BクラスのモデルはQ4で約47GBとなりVRAMをほぼ使い切るため、長いコンテキストにはIQ4_XSなどより低い量子化が必要です。長いコンテキストを余裕をもって扱いたい場合、全精度運用、あるいは高並列サービスを行う場合は、単体96GBカードまたは複数GPUへの変更をご検討ください。
AI-High(RTX PRO 5000 48GB)
見積もり →
単体96GBカードでgpt-oss-120bを実行、モデル分割不要
約 120 萬
gpt-oss-120b(MoE、MXFP4)/高精度70B
gpt-oss-120bの重みは約60GB(総パラメータ116.8B/アクティブ5.1B)、単体96GBカードならKVキャッシュにも十分な余裕
256GB DDR5 ECC・32コア Threadripper PRO 9975WX
RTX PRO 6000 96GBの単体カードだけでgpt-oss-120bを完全に搭載でき、複数カードへの分散は不要です。同じ96GBカードでほぼ全精度の70Bも動かせるため、構成が最もシンプルで、遅延も最小限に抑えられます。
AI-Highend(RTX PRO 6000 96GB)
見積もり →
複数GPUによるテンソル並列:全精度70Bまたは分散120B
約 152 萬
全精度Llama 70B(FP16で約140GB)/分散gpt-oss-120b
複数GPU合計で140GB以上;WRX90プラットフォームはネイティブに96GBカード4〜7枚の連結に対応
256GB DDR5 ECC(さらに拡張可能)・96コア Threadripper PRO 9995WX
全精度70B(FP16で約140GB)は単体カードには収まらず、複数GPUによるテンソル並列が必須です。WRX90のネイティブな4〜7カード構成は、全精度70Bまたは高並列の120Bサービスに適しており、GPU間の帯域幅が鍵となります。
AMD-WRX90(4〜7カード並列プラットフォーム)
見積もり →

LLMのファインチューニング(LoRA/QLoRA)

ファインチューニングを左右するのはVRAMとシステムメモリであり、純粋な演算性能ではありません。QLoRAはベースモデルを4-bitに圧縮し、小さなLoRAアダプターのみを学習することで、8B–70Bクラスのハードルを単体カードで扱える水準まで下げます。ただし学習は長時間にわたる連続演算であり、メモリのソフトエラーが発生すると気づかないうちに学習結果全体が損なわれるため、70Bクラスの学習にはECCメモリと十分なシステムRAM(オプティマイザ/CPUオフロード用の余裕)を組み合わせることを推奨します。以下の数値はQLoRA 4-bit、バッチサイズ1、シーケンス長2048、gradient checkpointing有効時の保守的な見積もりです。

利用シーン · 代表的なモデル 推奨スペック 主な違い 推奨MAQ構成
入門向けファインチューニング:8Bモデルのカスタマイズ(接客トーン/分野別Q&A)
Llama 3.1 8B · Qwen3 8B · Gemma 3 12B
約14–16GB(QLoRA 4-bit);24GBカードならより長いコンテキストを確保可能
32GB DDR5から
12コア Ryzen 9
8BのQLoRAは単体24GBカードにとって最も快適なちょうど良い領域です。データセットが大きい場合やCPUオフロードが必要な場合は、システムメモリを64GBに増やすことを推奨します。
AI-Eco(RTX PRO 4000 24GB)
約 10 萬
見積もり →
中規模ファインチューニング:13B–32B(複数ターンの指示チューニング/文体調整)
Qwen3 14B · Gemma 3 27B · Qwen3 32B(ぎりぎり)
14Bは約20–22GB;27Bは約24–28GB;32Bは約28–32GB(QLoRA 4-bit+checkpointing)
64GB DDR5
16コア Ryzen 9 9950X3D
27BのQLoRAはオプティマイザ稼働時に32GB近くまで達するため、実用的なバッチサイズ/コンテキストを確保するには32GBカードが必要です。32Bは32GB上では短いシーケンスでのみ実行可能なため、長いシーケンスには48GB(AI-High)を推奨します。
AI-Medium-Gemma(RTX PRO 4500 32GB)
約 27 萬
見積もり →
ローカルでの70Bフラッグシップ・ファインチューニング(QLoRA、単体カード)
Llama 3.3 70B · Qwen3 72Bクラス
約46–48GB(QLoRA 4-bit、シーケンス長約7K);標準LoRA(非量子化)は約160GB
256GB DDR5 ECC
32コア Threadripper PRO 9975WX
70BのQLoRAは約46–48GB必要です。48GBカードでも収まりますが、シーケンス長とバッチサイズを上限ぎりぎりで運用する必要があります。96GBカードであれば、シーケンスの延長、バッチサイズの拡大、オプティマイザ状態の保持に余裕を持たせられます。ECC+256GB RAMは、長時間の学習がソフトエラーによって台無しになるのを防ぐためのものです。全精度LoRA(約160GB)が必要な場合はマルチGPUプラットフォームをご検討ください。
AI-Highend(RTX PRO 6000 96GB)
約 120 萬
見積もり →
全精度LoRA/マルチGPU分散による70Bファインチューニング(研究レベル)
Llama 3.3 70B · Qwen3 72B(bf16 LoRA)
標準LoRAは約160GB→複数GPU(例:2×96GB)が必要;単体96GBなら高精度QLoRA+長いシーケンスに対応可能
256GB DDR5 ECC
32〜96コア Threadripper PRO
WRX90のネイティブな4〜7カード構成は、非量子化の70B LoRA、または複数のファインチューニング実験を同時に実行する用途に適しています。単体96GBカードで高精度QLoRAが足りる場合は、AI-Highend(約NT$1,200,000)への変更もご検討ください。
AMD-WRX90(4〜7カード並列プラットフォーム)
約 152 萬
見積もり →
入門向けファインチューニング:8Bモデルのカスタマイズ(接客トーン/分野別Q&A)
約 10 萬
Llama 3.1 8B · Qwen3 8B · Gemma 3 12B
約14–16GB(QLoRA 4-bit);24GBカードならより長いコンテキストを確保可能
32GB DDR5から・12コア Ryzen 9
8BのQLoRAは単体24GBカードにとって最も快適なちょうど良い領域です。データセットが大きい場合やCPUオフロードが必要な場合は、システムメモリを64GBに増やすことを推奨します。
AI-Eco(RTX PRO 4000 24GB)
見積もり →
中規模ファインチューニング:13B–32B(複数ターンの指示チューニング/文体調整)
約 27 萬
Qwen3 14B · Gemma 3 27B · Qwen3 32B(ぎりぎり)
14Bは約20–22GB;27Bは約24–28GB;32Bは約28–32GB(QLoRA 4-bit+checkpointing)
64GB DDR5・16コア Ryzen 9 9950X3D
27BのQLoRAはオプティマイザ稼働時に32GB近くまで達するため、実用的なバッチサイズ/コンテキストを確保するには32GBカードが必要です。32Bは32GB上では短いシーケンスでのみ実行可能なため、長いシーケンスには48GB(AI-High)を推奨します。
AI-Medium-Gemma(RTX PRO 4500 32GB)
見積もり →
ローカルでの70Bフラッグシップ・ファインチューニング(QLoRA、単体カード)
約 120 萬
Llama 3.3 70B · Qwen3 72Bクラス
約46–48GB(QLoRA 4-bit、シーケンス長約7K);標準LoRA(非量子化)は約160GB
256GB DDR5 ECC・32コア Threadripper PRO 9975WX
70BのQLoRAは約46–48GB必要です。48GBカードでも収まりますが、シーケンス長とバッチサイズを上限ぎりぎりで運用する必要があります。96GBカードであれば、シーケンスの延長、バッチサイズの拡大、オプティマイザ状態の保持に余裕を持たせられます。ECC+256GB RAMは、長時間の学習がソフトエラーによって台無しになるのを防ぐためのものです。全精度LoRA(約160GB)が必要な場合はマルチGPUプラットフォームをご検討ください。
AI-Highend(RTX PRO 6000 96GB)
見積もり →
全精度LoRA/マルチGPU分散による70Bファインチューニング(研究レベル)
約 152 萬
Llama 3.3 70B · Qwen3 72B(bf16 LoRA)
標準LoRAは約160GB→複数GPU(例:2×96GB)が必要;単体96GBなら高精度QLoRA+長いシーケンスに対応可能
256GB DDR5 ECC・32〜96コア Threadripper PRO
WRX90のネイティブな4〜7カード構成は、非量子化の70B LoRA、または複数のファインチューニング実験を同時に実行する用途に適しています。単体96GBカードで高精度QLoRAが足りる場合は、AI-Highend(約NT$1,200,000)への変更もご検討ください。
AMD-WRX90(4〜7カード並列プラットフォーム)
見積もり →

画像生成(Stable Diffusion/Flux/ComfyUI)

画像生成でVRAM消費の鍵を握るのはモデルサイズではなく「同時常駐」です——拡散モデル本体、VAE、テキストエンコーダー(FluxもSD3.5もT5-XXLを搭載)は、生成のその瞬間すべてがGPUに載っている必要があります。SDXLは量子化後8–12GBで動作しますが、Flux.1 dev(12B)を全精度で動かすには24GB以上が必要です。Flux LoRAの高品質な学習だけでも48GBが必要で、学習と推論を同時に常駐させるには96GBが必要になります。2026年時点で、ComfyUIは依然としてローカルワークフローの主流です。以下のVRAM数値はいずれも保守的な区間であり、量子化の前提を明記しています。

利用シーン · 代表的なモデル 推奨スペック 主な違い 推奨MAQ構成
SDXL 入門から上級まで(ComfyUIワークフロー/スタイルLoRA推論)
SDXL 1.0 · Illustrious XL(fp16)
8–12GB(fp16、1024²);ControlNet+IP-Adapterを2セット重ねるとさらに5–8GB追加
32GB DDR5
12コア Ryzen 9
24GBは純粋なSDXL推論には十分すぎるほどで、複数のControlNetを重ねても問題なく動作します。Flux fp8もぎりぎり動かせます。予算が最も限られている場合の妥当な出発点です。
AI-Eco(RTX PRO 4000 24GB)
約 10 萬
見積もり →
ComfyUIメイン機:Flux.1とSDXLの併用、バッチ出力
Flux.1 dev/schnell(12B)· SD3.5 Large(8B)· SDXL
Flux.1のfp8は約17GB、Q4 GGUFは約12GB;SD3.5 Largeのfp8は約11–14GB
64GB DDR5
16コア Ryzen 9 9950X3D
RTX PRO 4500 32GBはFlux.1のfp8とSD3.5 Largeを快適に動かせ、Flux併用の画像生成における32GBクラスの選択肢です。Flux.1の完全なfp16(24GB以上)が必要な場合は48GBのAI-Highへ、LoRAの学習と推論を同時に行いたい場合は単体96GBカードのAI-Highendへのアップグレードが必要です。NVIDIAのCUDAエコシステム、長時間稼働に安定したProドライバーを備えます。
AI-Medium-Gemma(RTX PRO 4500 32GB)
約 27 萬
見積もり →
LoRA学習と推論を同時実行/Flux全精度(商用制作ライン)
Flux.1 dev(fp16+LoRA学習)· SD3.5 Large · SDXL
Flux LoRA学習には48GBを推奨;学習と推論を同時に行うには余裕を持って48GB必要(保守的な見積もり)
256GB DDR5 ECC
32コア Threadripper PRO 9975WX
Flux LoRAの高品質な学習だけでも約48GBが必要で、学習に加えて推論用のVRAMも確保しOOMを避けるには、「同時常駐」の基準は単体96GBカードとなります。48GBのAI-Highでも対応は可能ですが、学習と推論を時間で切り分けて運用する必要があります。ECCメモリは、途切れることのない商用制作ラインに適しています。
AI-Highend(RTX PRO 6000 96GB)
約 120 萬
見積もり →
SDXL 入門から上級まで(ComfyUIワークフロー/スタイルLoRA推論)
約 10 萬
SDXL 1.0 · Illustrious XL(fp16)
8–12GB(fp16、1024²);ControlNet+IP-Adapterを2セット重ねるとさらに5–8GB追加
32GB DDR5・12コア Ryzen 9
24GBは純粋なSDXL推論には十分すぎるほどで、複数のControlNetを重ねても問題なく動作します。Flux fp8もぎりぎり動かせます。予算が最も限られている場合の妥当な出発点です。
AI-Eco(RTX PRO 4000 24GB)
見積もり →
ComfyUIメイン機:Flux.1とSDXLの併用、バッチ出力
約 27 萬
Flux.1 dev/schnell(12B)· SD3.5 Large(8B)· SDXL
Flux.1のfp8は約17GB、Q4 GGUFは約12GB;SD3.5 Largeのfp8は約11–14GB
64GB DDR5・16コア Ryzen 9 9950X3D
RTX PRO 4500 32GBはFlux.1のfp8とSD3.5 Largeを快適に動かせ、Flux併用の画像生成における32GBクラスの選択肢です。Flux.1の完全なfp16(24GB以上)が必要な場合は48GBのAI-Highへ、LoRAの学習と推論を同時に行いたい場合は単体96GBカードのAI-Highendへのアップグレードが必要です。NVIDIAのCUDAエコシステム、長時間稼働に安定したProドライバーを備えます。
AI-Medium-Gemma(RTX PRO 4500 32GB)
見積もり →
LoRA学習と推論を同時実行/Flux全精度(商用制作ライン)
約 120 萬
Flux.1 dev(fp16+LoRA学習)· SD3.5 Large · SDXL
Flux LoRA学習には48GBを推奨;学習と推論を同時に行うには余裕を持って48GB必要(保守的な見積もり)
256GB DDR5 ECC・32コア Threadripper PRO 9975WX
Flux LoRAの高品質な学習だけでも約48GBが必要で、学習に加えて推論用のVRAMも確保しOOMを避けるには、「同時常駐」の基準は単体96GBカードとなります。48GBのAI-Highでも対応は可能ですが、学習と推論を時間で切り分けて運用する必要があります。ECCメモリは、途切れることのない商用制作ラインに適しています。
AI-Highend(RTX PRO 6000 96GB)
見積もり →

AI Agent/エージェント型ワークフロー(n8n/LangGraph/CrewAI)

このワークロードのボトルネックはCPUコア数、メモリ、ネットワークI/Oであり、高性能な単体GPUではありません。オーケストレーションエンジンの多くは「LLM APIを呼び出す→応答を待つ→JSONを解析する→次のノードへ進む」というループで動作し、各ツール呼び出しがCPUスレッドを1本占有します。複数エージェントを並列実行する際に効いてくるのはコア数と32GBのメモリです。VRAMが重要になるのは、推論を完全にオンプレミスへ移す(プライバシー/オフライン利用/API費用削減のため)場合に限られ、その場合でもエージェント型ワークフローは多くの場合8B〜20Bクラスの軽量ローカルモデルで足り、70Bまでは不要です。

利用シーン · 代表的なモデル 推奨スペック 主な違い 推奨MAQ構成
純粋なオーケストレーション:マルチエージェントフロー、LLMはすべてクラウドAPI経由
クラウドAPI主体(ローカルは埋め込み/分類のみ担当)
単体GPUの要件は0GB(内蔵グラフィックスで十分);ローカル埋め込みは約1–2GB
32GB DDR5
6–10コア(クロック周波数よりコア数が重要)
オーケストレーションはI/Oとスレッドに負荷がかかる処理であり、演算負荷が高いわけではありません。6–10コア+32GBあれば数十本のエージェントを並列実行できます。n8n/LangGraph/CrewAI/Ollama/Open WebUIをプリインストール済みで、開梱してすぐに使えます——この段階で高性能な単体GPUに投資するのは無駄になります。
AI-Agent-Medium/Eco
約 3.3 萬
見積もり →
ハーフローカル:一部ノードを軽量ローカルLLM(8Bクラス)に切り替え
Qwen3 8B · Llama 3.1 8B(Q4_K_M)
約5–8GB(4-bit、16Kコンテキスト以内)
32GB DDR5
6–10コア
8Bクラスは量子化後5–8GBに収まり、内蔵グラフィックスや入門レベルのiGPUでも約30–40 tok/sで動作でき、エージェントフロー内の分類・抽出・ツールルーティングには十分です。より高速な処理や高い並列度が必要な場合のみ、単体GPUの追加が必要になります。
AI-Agent-Medium/Eco
約 3.3 萬
見積もり →
ローカル推論のコア:主力LLMをオンプレミス化(20Bクラス、オフライン/API費用削減)
gpt-oss-20b(MXFP4)· Qwen3 14B
約16GB(gpt-oss-20bはMoE+MXFP4、重みは約12–13GB、実行時は約16GB);長いコンテキストには24–32GBを推奨
64GB DDR5
12コア
API費用が負担になってきた場合、またはコンプライアンス上データを社外に出せない場合に、このクラスへのアップグレードをご検討ください。AI-Medium(Radeon AI PRO R9700 32GB)とAI-Eco(RTX PRO 4000 24GB)はいずれもコンテキストに余裕を残し、gpt-oss-20b/Llamaをプリロード済みでオーケストレーターにそのまま接続できます。
AI-Medium/AI-Eco
約 16 萬
見積もり →
重量級ローカルエージェント:70Bクラスの複雑な推論チェーン/長文書エージェント
Llama 3.3 70B · Qwen3 72B(Q4_K_M)
約42–45GB(4-bit);48GBが単体カードの安全な下限で、本機はまさに48GB
128GB DDR5 ECC
24コア Threadripper
エージェント型ワークフローのほとんどは70Bまで必要としませんが、このクラスは完全に自律したローカルの高品質な推論チェーンが必要な場合向けです。全精度やより長いコンテキストが必要な場合は、デュアルGPUまたは96GB機種をご検討ください。
AI-High(RTX PRO 5000 48GB)
約 61 萬
見積もり →
純粋なオーケストレーション:マルチエージェントフロー、LLMはすべてクラウドAPI経由
約 3.3 萬
クラウドAPI主体(ローカルは埋め込み/分類のみ担当)
単体GPUの要件は0GB(内蔵グラフィックスで十分);ローカル埋め込みは約1–2GB
32GB DDR5・6–10コア(クロック周波数よりコア数が重要)
オーケストレーションはI/Oとスレッドに負荷がかかる処理であり、演算負荷が高いわけではありません。6–10コア+32GBあれば数十本のエージェントを並列実行できます。n8n/LangGraph/CrewAI/Ollama/Open WebUIをプリインストール済みで、開梱してすぐに使えます——この段階で高性能な単体GPUに投資するのは無駄になります。
AI-Agent-Medium/Eco
見積もり →
ハーフローカル:一部ノードを軽量ローカルLLM(8Bクラス)に切り替え
約 3.3 萬
Qwen3 8B · Llama 3.1 8B(Q4_K_M)
約5–8GB(4-bit、16Kコンテキスト以内)
32GB DDR5・6–10コア
8Bクラスは量子化後5–8GBに収まり、内蔵グラフィックスや入門レベルのiGPUでも約30–40 tok/sで動作でき、エージェントフロー内の分類・抽出・ツールルーティングには十分です。より高速な処理や高い並列度が必要な場合のみ、単体GPUの追加が必要になります。
AI-Agent-Medium/Eco
見積もり →
ローカル推論のコア:主力LLMをオンプレミス化(20Bクラス、オフライン/API費用削減)
約 16 萬
gpt-oss-20b(MXFP4)· Qwen3 14B
約16GB(gpt-oss-20bはMoE+MXFP4、重みは約12–13GB、実行時は約16GB);長いコンテキストには24–32GBを推奨
64GB DDR5・12コア
API費用が負担になってきた場合、またはコンプライアンス上データを社外に出せない場合に、このクラスへのアップグレードをご検討ください。AI-Medium(Radeon AI PRO R9700 32GB)とAI-Eco(RTX PRO 4000 24GB)はいずれもコンテキストに余裕を残し、gpt-oss-20b/Llamaをプリロード済みでオーケストレーターにそのまま接続できます。
AI-Medium/AI-Eco
見積もり →
重量級ローカルエージェント:70Bクラスの複雑な推論チェーン/長文書エージェント
約 61 萬
Llama 3.3 70B · Qwen3 72B(Q4_K_M)
約42–45GB(4-bit);48GBが単体カードの安全な下限で、本機はまさに48GB
128GB DDR5 ECC・24コア Threadripper
エージェント型ワークフローのほとんどは70Bまで必要としませんが、このクラスは完全に自律したローカルの高品質な推論チェーンが必要な場合向けです。全精度やより長いコンテキストが必要な場合は、デュアルGPUまたは96GB機種をご検討ください。
AI-High(RTX PRO 5000 48GB)
見積もり →

デスクトップ型ミニAI開発機(GB10統合メモリ)

このクラスは、GPU搭載型ワークステーションとは異なる選択肢です。「1枚の大型グラフィックカード+システムメモリ」ではなく、NVIDIA GB10 Grace Blackwellスーパーチップを採用し、CPUとGPUが128GBの統合メモリを1つのプールとして共有します。利点は、単機で100Bクラスの大型モデルをロードしてローカル推論・開発ができることで、本体サイズはミニPC相当、専用サーバールームや専用電源も不要です。一方でメモリ帯域幅(LPDDR5X、約273GB/s)はデータセンター級のHBMより大幅に低く、トークン生成速度は毎秒数十個にとどまります。位置づけは「ローカルでの開発・検証・常駐エージェント」であり、外部向けの高並列推論サービスではありません。個人や小規模チームがAI開発をデスクに持ち込み、データを社外に出さない用途に適しています。

利用シーン · 代表的なモデル 推奨スペック 主な違い 推奨MAQ構成
デスクサイドでのローカル開発:単機で100Bクラスの大型モデル推論
Nemotron 3 Super 120B(MoE)· Llama 3.3 70B · Qwen3 80B(量子化)
128GBの統合メモリを共有(CPU+GPU);120Bクラスは4-bit量子化で約60GBを占有
128GB 統合メモリ
20コア ARM(Cortex-X925+A725)
NVIDIA DGX Sparkと同じGB10スーパーチップと128GB統合メモリを搭載し、違いは1TB SSDとブランドで、価格はより低めです。GB10プラットフォームをより低い導入コストで入手し、ローカルLLMの開発・推論に活用したい場合に適しています。生成速度はメモリ帯域幅に制約され、高並列サービス向けではありません。
ASUS Ascent GX10(GB10/1TB)
約 18 萬
見積もり →
常駐エージェント/より大きなローカルストレージが必要な開発機
上記と同様、長時間常駐する自律エージェントにも適しています
128GBの統合メモリを共有
128GB 統合メモリ
20コア ARM(Cortex-X925+A725)
NVIDIA純正のDGX Sparkは、4TBのNVMe SSDによりローカルストレージ容量が大きく、多数のモデルやデータセットを本体に保存しておきたい開発者に適しています。統合メモリアーキテクチャはGX10と同一で、選ぶ理由は主により大きなストレージとNVIDIA純正であることにあります。
NVIDIA DGX Spark(GB10/4TB)
約 21 萬
見積もり →
デスクサイドでのローカル開発:単機で100Bクラスの大型モデル推論
約 18 萬
Nemotron 3 Super 120B(MoE)· Llama 3.3 70B · Qwen3 80B(量子化)
128GBの統合メモリを共有(CPU+GPU);120Bクラスは4-bit量子化で約60GBを占有
128GB 統合メモリ・20コア ARM(Cortex-X925+A725)
NVIDIA DGX Sparkと同じGB10スーパーチップと128GB統合メモリを搭載し、違いは1TB SSDとブランドで、価格はより低めです。GB10プラットフォームをより低い導入コストで入手し、ローカルLLMの開発・推論に活用したい場合に適しています。生成速度はメモリ帯域幅に制約され、高並列サービス向けではありません。
ASUS Ascent GX10(GB10/1TB)
見積もり →
常駐エージェント/より大きなローカルストレージが必要な開発機
約 21 萬
上記と同様、長時間常駐する自律エージェントにも適しています
128GBの統合メモリを共有
128GB 統合メモリ・20コア ARM(Cortex-X925+A725)
NVIDIA純正のDGX Sparkは、4TBのNVMe SSDによりローカルストレージ容量が大きく、多数のモデルやデータセットを本体に保存しておきたい開発者に適しています。統合メモリアーキテクチャはGX10と同一で、選ぶ理由は主により大きなストレージとNVIDIA純正であることにあります。
NVIDIA DGX Spark(GB10/4TB)
見積もり →
なぜ自作(DIY)ではないのか

企業のAI導入で苦労する部分を、MAQは出荷前に済ませます

最適な仕様を選ぶのは最初の一歩に過ぎません。IT担当者を本当に悩ませるのは、裸機が届いた後の環境構築地獄とチューニングの落とし穴です——MAQはこの前段階の作業を出荷前にすべて完了させます。

大手メーカーの裸機を自分で購入した場合

  • 環境が何もない状態で機器が届き、Ubuntu・CUDAドライバー・Dockerの権限設定だけでIT担当者は2週間以上を費やします。
  • PCIeレーンの割り当てを誤ると、マルチGPUの性能が半減し、しかも原因の特定が困難です。
  • 仕様を勘に頼って購入し、過剰投資で予算を無駄にするか、不足して行き詰まる——誰も計算を手伝ってくれません。

MAQなら開梱してすぐ使える · ワンストップでチューニング済み

  • 出荷時にOllama(Qwen/Gemma)、ComfyUI、社内ナレッジベースをプリインストール。電源とネットワークをつなぐだけで5分以内にAPIを提供できます。
  • 出荷前にエンジニアがストレステストとPCIeトポロジー調整を実施し、マルチGPUのPCIe 5.0レーンを正しく割り当て、性能を最大限引き出します。
  • ご予算とモデルサイズに応じて、専任担当者が最適化されたGPU構成をご提案します——それが上記でご覧いただいた対照表です。
ワンストップのハードウェア+ソフトウェア統合サービス

環境構築済み、電源を入れてすぐ使える、地域密着の技術サポート

一本のお電話から起動後のAI提供開始まで、MAQがすべて対応します。ドライバーに触れる必要も、PCIeを調べる必要も、自分でストレステストを行う必要もありません——お客様はご自身のAIアプリケーションに専念いただけます。

1

仕様のご相談

ご予算と動かすモデルをお伝えいただければ、専任担当者が過剰投資も行き詰まりもない最適化されたGPU構成をご提案します。

2

カスタム組み立て

産業グレードの部材、エンタープライズ級の電源と冷却、マルチGPUのPCIe 5.0トポロジー最適化を行います。

3

ストレステスト + 環境プリインストール

バーンインストレステストを実施し、Ollama/ComfyUI/CUDA/Docker/社内ナレッジベースをプリインストールします。

4

エンジニアによる直接納品

台湾全土(離島を含む)へ直接お届けし現地で動作確認、電源とネットワーク接続後5分以内にAPIを提供します。

5

地域密着の技術サポート

3年間のハードウェア保証、契約アカウント向け代替機貸出、Proxmox VEおよびハードウェア障害対応の専門家級サポートをリモート・訪問の両方でご提供します。

企業向けオンプレミス生成AI · ハードウェア+ソフトウェア一体型

MAQ Alishan 企業向けAIナレッジアプライアンス

文書・SOP・データベース内の知識を、会話で問い合わせられるプライベートAIに変換します。RAGナレッジベース×ナレッジグラフ×権限監査のすべてを自社専用のAIサーバー内にとどめ、機密データを外部に出しません。規模に応じて2つのグレードからお選びいただけます。

Alishan スタンダード

中小企業向け · 部門ナレッジベース
  • 単体32–48GB級GPUで7B–32Bのローカルモデルを実行
  • 社内RAGナレッジベース構築(人事/IT/営業のQ&A対応)
  • 権限管理と操作監査により、データは社内ネットワークにとどまります
スタンダード版を見る →
フラッグシップ

Alishan フラッグシップ

大規模研究機関 · データセンター向け
  • RTX PRO 6000 96GB、または複数のBlackwell GPUを連結
  • 単一カードでgpt-oss-120bを完全ロード、またはLlama 3.3 70Bのファインチューニングに対応
  • 高並列処理、ナレッジグラフ、企業級監査に対応、実測161 tok/s
フラッグシップ版を見る →
エンタープライズ級のサービス保証

MAQでご購入いただければ、AI導入後に孤立することはありません

購入前の仕様相談から、導入後の技術サポートと保証対応まで、2002年から続く台湾拠点のチームが一貫してサポートいたします。

ハードウェア仕様のカスタム相談

ご予算と動かすモデルサイズに応じて、専任担当者が最適化されたGPU/メモリ/CPU構成をご提案します。過剰投資も行き詰まりもありません。

オンプレミスのセキュリティ保証

すべての演算とデータは100%オンプレミスで保持されます。モデル、ナレッジベース、対話履歴は社内ネットワーク外に出ることがなく、個人情報や営業秘密の漏洩リスクはありません。

台湾国内の保証と技術サポート

Proxmox VE仮想化環境、ハードウェア障害対応の専門家級コンサルティング、3年間のハードウェア保証、契約アカウント向け代替機貸出サービス、そしてエンジニアによる台湾全土(離島を含む)への直接納品と現地動作確認を提供します。

FAQ

AI購入に関するよくあるご質問

2026年にLlama 3.3 70Bをローカルで動かすには、どのようなハードウェア構成にすればよいですか。VRAMはどのくらい必要ですか。

4-bit(Q4_K_M)量子化であれば約43GBのVRAMが必要で、単体48GBのプロフェッショナルカードで対応でき、システムメモリは128GB ECCを推奨します。同クラスのQwen3 72BはQ4で約47GBとなり48GBカードで上限に近づくため、長いコンテキストにはより低い量子化(IQ4_XS)が必要です。対応するMAQの構成であるAI-HighはRTX PRO 5000 48GB版を採用しており、4-bitの70Bを動かした際の余裕は約5GBです。長いコンテキストを余裕を持って扱いたい場合、全精度運用、あるいは高並列処理が必要な場合は、単体96GBカードまたは複数GPUへの変更をご検討ください。対応するMAQの機種はAI-High(約NT$610,000)です。

gpt-oss-120bを導入するには、マルチGPUサーバーを購入する必要がありますか。単体96GBカードで動かせますか。

単体カードで動作し、マルチGPUは不要です。gpt-oss-120bはMoEアーキテクチャとネイティブMXFP4量子化を採用しており、重みは約60GB。単体のNVIDIA RTX PRO 6000 Blackwell 96GBカードで完全にロードでき、KVキャッシュにも十分な余裕を残せるため、構成が最もシンプルで遅延も最小限に抑えられます。全精度運用や高スループット・高並列サービスが必要な場合のみ、マルチGPUのWRX90プラットフォームが必要になります。対応するMAQの機種はAI-Highend(約NT$1,200,000)です。

Flux.1 dev向けの画像生成ワークステーションでは、OOMを避けるためにVRAMとメモリをどのくらい確保すればよいですか。

Flux.1 dev(12B)で生成する際は、拡散モデル本体、VAE、T5-XXLテキストエンコーダーがすべて同時にGPUに常駐する必要があります:fp8で約17GB、完全なfp16で約24GB、SDXLのfp16で約8–12GBです。32GBカード(RTX PRO 4500など)であればFlux.1のfp8とSD3.5を快適に動かせます。LoRAの学習と推論を同時に行う場合は、48GBあるとより余裕を持てます。システムメモリは64GBを出発点として推奨します。対応する画像生成向けMAQの機種はAI-Medium-Gemma(RTX PRO 4500 32GB、約NT$270,000)です。

n8nやLangGraphでAI Agentのワークフローを構築するのに、高性能なグラフィックカードは必要ですか。

多くの場合、必要ありません。n8n/LangGraph/CrewAIは主にクラウドまたは軽量なローカルLLM APIを呼び出す構成のため、ボトルネックはCPUコア数と32GBのメモリであり、高性能な単体GPUではありません。GPUが必要になるのは推論を完全にオンプレミスへ移す場合(プライバシー/オフライン利用/API費用削減のため)に限られ、その場合でも通常は8B–20Bクラスの軽量モデルで十分です。MAQのAI Agent代理PCはn8n/LangGraph/CrewAI/Ollamaをプリロード済みで、価格は約NT$34,000です。

複数GPU(マルチカード)はどう構成すればよいですか。全精度70Bや分散型120Bを動かすには何枚必要ですか。

全精度のLlama 70B(FP16で約140GB)は単体カードには収まらず、複数GPUによるテンソル並列が必要です。AMD WRX90プラットフォームはネイティブに4〜7枚のGPU連結に対応しており、全精度70Bや高並列の分散型120Bサービスに適しています。GPU間の帯域幅が鍵となります。対応するMAQの機種はAMD-WRX90(RTX PRO 6000 96GBを4〜7枚連結、約NT$1,520,000)です。

Llama 70Bをローカルでファインチューニングするには、VRAMとメモリはどのくらい必要ですか。

QLoRA 4-bitで70Bをファインチューニングするには約46–48GBのVRAMが必要で、単体48GBカードが入門仕様となります。AI-High(RTX PRO 5000 48GB)でも動作しますが、シーケンス長とバッチサイズを上限ぎりぎりで運用する必要があるため、この用途では単体96GBカードのAI-Highendを推奨します。ECCメモリと128GB以上のシステムRAMを組み合わせることで、長時間の学習がメモリのソフトエラーによって台無しになるのを防げます。標準(非量子化)LoRAには約160GBが必要で、複数GPUまたは大容量の96GBカードが必要です。対応するMAQの機種はAI-High(約NT$610,000)です。

デスクの上で単機で100Bクラスの大型モデルを動かしたい場合、DGX Sparkのようなミニ機とGPUワークステーションのどちらを選ぶべきですか。

用途によります。NVIDIA DGX SparkとASUS Ascent GX10はNVIDIA GB10スーパーチップと128GBの統合メモリを採用しており、単機で100Bクラスの大型モデルをロードしてローカル推論・開発が行え、本体サイズはミニPC相当でサーバールームも不要なため、ローカルでの開発・検証・常駐エージェントに適しています。ただしメモリ帯域幅(約273GB/s)はデータセンター級のハードウェアより低く、トークン生成速度は毎秒数十個にとどまるため、外部向けの高並列サービスには不向きです。複数ユーザー向けに高スループットの推論を提供する場合や、画像生成・大規模ファインチューニングを行う場合は、GPU搭載型ワークステーション(AI-High/AI-Highendなど)がより適しています。対応するMAQの機種:ASUS Ascent GX10(約NT$180,000)、NVIDIA DGX Spark(約NT$210,000)。

それでも構成にお迷いですか。

動かしたいモデル、用途、ご予算をMAQにお伝えください。エンジニアが過不足のない最適な構成を算出いたします。

企業向けオンプレミスソリューション Alishan を見る → · 関連記事:MAQブログの購入評価と選定ガイド →