ローカルLLMで、AI駆動開発を始める。
GPUマシンも環境構築も、
ワンパッケージでお届けします。
外部通信を行わない完全クローズド構成も選べますこんな会社に
向いています
「ローカルLLMを前提にAI駆動開発を進めたい」という企業様が増えています。背景にあるのは、コスト・セキュリティ・自律性という3つの理由です。
「ローカルLLMは性能が心配」という理由で導入を見送ってきた企業様にこそ、実際の構成と実測データをご確認いただきたいと考えています。
こんな課題をお持ちの企業様へ
社内規定でクラウド生成AIの業務利用に制限がある
セキュリティポリシー上、コードや設計情報をクラウドAIに渡せない開発現場でも、外部通信を行わない完全クローズド構成でAI駆動開発を実践できます。
顧客の機密情報を扱う開発案件が多い(SIer・受託開発)
一社貸切での演習に加え、クラウドに渡す文面から機密語を自動でマスクする仕組みも紹介。機密性の高い業務でも安心して導入いただけます。
生成AIのAPI費用が増え、コスト最適化を迫られている
定型的な工程はローカルLLMが担当し、品質を左右する工程だけClaudeに任せることで、出力の質を保ったままAPI費用を大きく抑えられます。
ひとつでも当てはまれば、検討の価値があります
導入形態は2つから選べます
コスト優先か、外部通信ゼロか。自社の要件に合わせて選択できます
ハイブリッド型
ローカルLLM(Qwen等)が進行役となり、品質を左右する一部の工程だけをClaudeに委譲する構成。
- ✓Claude費用を平均61%削減(実測値)
- ✓成果物の品質はClaude単独と同等
- ✓委譲する工程は自社の方針に合わせて調整可能
完全クローズド型
ローカルLLMのみで完結し、開発中のコードや設計情報が一切外部に出ない構成。
- ✓インターネット接続がない環境でも運用可能
- ✓情報セキュリティ規定が厳しい現場にも対応
- ✓自社データを使った精度検証にも対応
ハードウェアも、ひとつのパッケージに。
Hexabaseはインフラ基盤を自社で運用するプラットフォーマーです。
GPUマシンそのものと、AIエージェント・開発環境の構築までを一式にしたパッケージ「AI Devbox」として販売しています。社内に設置するだけで、すぐに使い始められます。
守れる
データは社内から出さない構成。クラウド利用は難易度の高い工程を委譲するときだけです。
すぐ使える
GPUマシンの調達・モデルのセットアップ・ルーティング設定まで完了した状態で納品するため、導入初日から着手できます。
自社で育てる
専門家が不在でも、業務知識をもとに自社専用のAIモデルへ育てていけます。OSS構成のためベンダーロックインもありません。
箱の中身
基盤にはオンプレミスKubernetes「Kubo」を採用し、KubeAI・Langfuse・Grafana等のOSSと、コーディングエージェントやGitOpsによる開発・運用ツールを組み合わせています。特定ベンダーへの依存を抑えた構成です。
仕組み:役割分担で、品質を落とさない
「ローカルLLM=性能を我慢する」のではなく、工程ごとに得意なモデルへ振り分けることで、コストを抑えながら品質を維持します。
- 1
依頼を工程ごとに分解する
1つの開発依頼を「設計」「実装」「レビュー」などの工程に分け、工程ごとに担当させるモデルを決めます。
- 2
基本はローカルLLMが進行する
手元のGPUマシン上で動くローカルLLM(Qwen等)が、定型的な工程を進めます。情報は外に出ません。
- 3
難易度の高い工程だけClaudeに委譲する
設計の妥当性確認や最終レビューなど、品質を左右する工程だけをClaudeに任せます。委譲のたびに新しい会話として渡すため、余分な文脈まで送られることがありません。
- 4
結果を統合し、誰が担当したかを記録する
ローカルLLMとClaudeの結果を統合して成果物にします。どの工程を誰が担当したかは、あとから確認できます。
機密情報はクラウドに送る前に自動でマスクすることができる
氏名・メールアドレス・電話番号など、クラウドに渡す文面に含まれる機密情報は自動で伏せ字に置き換えることができ、結果を受け取る際に元に戻せます。ローカルLLMのみで進む工程では原文のまま扱われるため、必要以上に情報を外へ出さずに済みます。
実測データ
同一の依頼(提案資料作成タスク)を「Claude単独」と「ハイブリッド構成」でそれぞれ1回ずつ実行した実測値です。
| 指標 | Claude単独 | ハイブリッド | 差分 |
|---|---|---|---|
| Claude費用 | $4.39 | $1.73 | −61% |
| Claude出力トークン | 75,634 | 24,980 | −67% |
| Claudeのモデル呼び出し回数 | 94回 | 35回 | −63% |
| 所要時間 | 約24分 | 19.7分 | 約−4分 |
| 成果物の品質(画像レビュー) | 95.4 | 94.8(合格) | 同等 |
※各構成1回ずつの実行結果であり、実行ごとのばらつきは含まれます。目視での品質確認・機械検査でも差は確認されていません。こうした効果測定の考え方自体も、導入時にあわせてお伝えしています。
※実案件(提案資料作成タスク)での実測値。品質は同等(画像レビュー・目視確認で確認済み)
料金プラン
GPUマシン本体を含むパッケージの買い切り+年間保守の4プランです。サブスクリプションはありません。外部通信を行わない構成をご希望の場合は、自社内GPUで完結するB〜Dが適合します。
ローカルLLMセットアップ済みのGPUマシンは、Bコンパクトなら本体価格480万円。500万円以下で手に入ります。
| プラン | 構成 | 本体価格 | 年間保守費用 | 合計金額 |
|---|---|---|---|---|
| A スタンダード | GPUなし・ミニPC3台LLMはお客様契約のクラウドを使用 | ¥3,400,000 | ¥700,000 | ¥4,100,000 |
| B コンパクト | GPU1台+ミニPC1台自社内GPUで完結(クラウド不使用) | ¥4,800,000 | ¥950,000 | ¥5,750,000 |
| C 1台構成 | GPU1台+ミニPC3台自社内GPUで完結(クラウド不使用) | ¥7,300,000 | ¥1,200,000 | ¥8,500,000 |
| D 2台構成 | GPU2台+ミニPC3台自社内GPUで完結(クラウド不使用) | ¥10,600,000 | ¥1,600,000 | ¥12,200,000 |
※金額は税抜。合計金額=本体価格+年間保守費用(初年度)。正式なお見積りは構成・数量に応じて個別にご提示します。価格は2026年9月時点の計画値です。
FAQs
ローカルLLM前提の導入について、よくいただくご質問です。