コンテンツにスキップ

Qwen3.8-27BはCode Arena WebDevで総合9位、27Bモデルの強みと実務の限界

対象:

ローカルで動かすオープンウェイトモデルを、コーディング用途で比較している開発者

この記事のポイント

  • Qwen3.8-27BはAlibabaの27B Denseモデルで、Apache 2.0ライセンス、262,144トークン、画像・動画入力に対応する。43
  • Code Arena WebDevの2026年8月21日版では総合9位だが、これはWeb画面を人間の選好で比べる評価で、長時間エージェントの完遂率とは別である。
  • 4bit量子化ファイルは約17GBで、ローカルで試しやすい一方、主力採用は自分のタスクで成功率と実時間を測ってから判断する。

先に採用判断

この資料から言えること/まだ言えないこと

言えること: Web生成の選好順位、Qwen公表の5つのベンチマーク、モデルサイズと公開ライセンスは比較できる。

まだ言えないこと: 長時間エージェントの再現性と、新型Mac mini上の速度には独立した反復実測がない。

結論は、Web生成と補助コーディングでは比較候補、長時間の自律作業では検証候補である。 Code Arenaの順位だけで主力へ切り替えず、完了条件を固定した反復テストで判断する。16

Qwen3.8-27BのCode Arena上位評価とエージェント実務の検証不足を対比した判断図

Web生成で総合9位

Code Arena WebDevは、多段推論とツール利用を含むフロントエンド開発の出力を、人間の選好投票で比較するランキングである。 8月21日版の結果は次の通りだ。12

区分順位評価点順位幅
総合9位1595 ±138〜13位
Consumer Product6位1587 ±322〜15位
Brand & Marketing7位1627 ±243〜12位
Gaming8位1645 ±266〜13位

±13などは評価点に表示された不確実性、順位幅はその不確実性を踏まえてLeaderboardが示す推定順位の範囲である。 総合9位は上位候補に入った証拠だが、分野別の幅は広く、特定分野での固定的な優位までは示さない。

9位でも、長時間エージェントは別評価

Code Arena WebDevは、フロントエンド開発タスクの出力を人間の選好投票で比較する。 タスクには多段推論とツール利用も含まれるが、長いリポジトリ調査、テスト修正、失敗からの復帰、総所要時間は同じ軸ではない。1

公開された単発テストでは、約60万トークンのCコードを単一HTMLへ移植した。 同レポートは2つのQwen実行にhermescodehamrという名称を付けているが、ツール自体の定義は示していない。6

実行構成所要時間投稿者評価
Claude Code + Opus 521分okay
Qwen3.8-27B + hermes4時間18分bad
Qwen3.8-27B + codehamr1時間40分bad

Qwen側はRTX 6000 Pro 96GB、vLLM、FP8重み、FP8 KVキャッシュ、262,144トークンで動作していた。 各構成1回、追加入力なしで、元ファイルはコンテキスト長を超えている。 モデルだけでなくハーネスとプロンプトも違うため一般順位にはできないが、長時間タスクを別に試す必要性は分かる。

数字で見る公式ベンチマーク

Qwenのモデルカードが掲載するQwen3.8-27BとClaude Opus 4.6 Maxの比較は、得意分野が分かれている。3

指標Qwen3.8-27BOpus 4.6 Max高いモデル
SWE-bench Pro61.753.4Qwen
LiveCodeBench v690.388.8Qwen
Terminal-Bench 2.173.078.2Opus
GPQA Diamond89.291.3Opus
Humanity's Last Exam30.840.0Opus

比較条件は完全には統一されていない。 SWE-bench ProではOpus 4.6 Maxだけが公式報告値で、他モデルはQwen側がClaude Codeハーネスで評価している。 第三者のArtificial Analysisは、4Bから40Bの小型オープンウェイトクラスで9評価を統合するIntelligence Indexにおいて、Qwen3.8-27Bのxhigh設定を52点とした。この点数だけでは長時間エージェントの信頼性を判断できない。 同ページでは、出力速度が比較クラスの中央値を下回り、出力トークン量は中央値より多いが、この速度はAPIプロバイダ経由の測定であり、ローカル機材の実測ではない。5

採用時は、問題を解けるかだけでなく、完了までの時間、再試行、生成量を同じ条件で記録する必要がある。

ローカル実行に必要なメモリ

Qwen3.8-27Bは64層のDenseモデルで、48層のGated DeltaNetと16層のGated Attentionを組み合わせる。 ネイティブコンテキストは262,144トークンで、画像と動画の入力、Thinkingの切り替え、Apache 2.0ライセンスに対応する。3

精度・形式重みの目安容量判断
BF16約54GB64GB級でも周辺メモリの余裕を要確認
FP8約27GB32GBでは余裕が小さく、64GB級が現実的
4bit量子化実ファイル約17GB24GB級は短い試行向け、実用上の余裕を取るなら32GBから

実行時にはOS、推論ランタイム、KVキャッシュ、同時実行分を重みに加える。 ここでのMTP(Multi-Token Prediction)は、同レポートがdraft-mtpと記す投機的デコード設定を指す。7 QwenはThinkingを標準で有効にし、reasoning_effortの既定値をxhighとしているため、単純な作業では推論量も確認する。3 Qwenは、推論量を下げると失敗や再試行が増え、複数ターンでは総所要時間が短くならない場合もあると説明している。3

Simon Willison氏の環境では、このMTP構成がLM Studioの既定GGUF構成より約72%高速だった。 これは同氏の環境内の差だが、モデルだけでなく実行設定も測るべき理由になる。7

新型Mac miniとの組み合わせ

Appleが8月25日に発表した新型Mac miniは、M6が16GB/24GB/32GB、M5 Proが最大64GBである。89 約17GBの4bit版ならM6の32GB構成、約27GBのFP8版ならM5 Proの64GB構成が容量面の起点になる。 価格と構成の選び方は、ガジェット記事「新型Mac miniは149,800円から」で確認できる。10

採用前に測る4項目

Qwen3.8-27Bを試す価値が高いのは、コードを外部APIへ送れない、ローカル推論の固定費を受け入れられる、短いWeb生成や補助作業から評価できる場合である。 逆に、長時間タスクを無監督で完遂すること、短い納期、再試行の少なさが必須なら、Arena順位だけで主力へ切り替えない。

同じタスクを複数回実行し、次の4項目を記録する。

  1. 事前に固定した完了条件とテスト
  2. モデル、量子化、コンテキスト、Thinking、ハーネス
  3. 成功率、実時間、再試行回数、GPU使用時間
  4. クラウドモデルとの差と、完了タスク当たりの費用

Code Arena上位は、Qwen3.8-27Bを試す理由になる。 主力採用の条件は、対象リポジトリで完了率と総所要時間が許容範囲に入ることである。

関連記事

出典


  1. Arena, Code Arena WebDev Overall Leaderboard(2026年8月26日確認)。8月21日版の総合順位、スコア、順位幅、投票数、評価対象を確認した。 

  2. Arena, Consumer ProductBrand & MarketingGaming(2026年8月26日確認)。分野別順位とスコアを確認した。 

  3. Qwen, Qwen3.8-27B Model Card(2026年8月26日確認)。アーキテクチャ、コンテキスト、ライセンス、Thinking設定、公式ベンチマークと評価条件を確認した。 

  4. Qwen Team, Alibaba Group, Qwen3 concepts(2026年8月26日確認)。プロジェクトの帰属とオープンウェイトモデル群を確認した。 

  5. Artificial Analysis, Qwen3.8 27B (xhigh)(2026年8月26日確認)。Intelligence Index v4.1.1、速度、出力トークン量、比較クラスを確認した。 

  6. Reddit r/LocalLLaMA, New qwen3.8:27b on a 39k line C to single-file HTML / three.js port(2026年8月26日確認)。投稿者による一回限りの比較であり、一般化できるベンチマークではない。 

  7. Simon Willison, Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things(2026年8月26日確認)。約17GBの4bitファイルと、特定環境におけるMTP構成の速度差を確認した。 

  8. Apple(日本), Mac miniを購入(2026年8月26日確認)。M6の16GB、24GB、32GB構成を確認した。 

  9. Apple Newsroom, Apple unveils a more powerful Mac mini featuring the all-new M6 and M5 Pro(2026年8月25日)。M5 Proの最大64GB構成を確認した。 

  10. SmartScope Gadgets, 新型Mac miniは149,800円から(2026年8月26日)。構成比較と発売前の実測不足を参照した。