Weblab-MedLLM-gpt-oss-120bを試してみた|医師国家試験でgpt-oss-120bと比較

AI・高火力 , さくらのクラウド # さくらのAI Engine

こんにちは、UOZUです!

9月24日に、さくらのAI Engineから医療特化型のLLM「Weblab-MedLLM-gpt-oss-120b」が公開されています。

早速確認していこうと思います。

利用には従量課金プランの契約が必要

今まで紹介した「preview/Qwen3.6-35B-A3B」などは、「基盤モデル無償プラン」でも利用できましたが、「Weblab-MedLLM-gpt-oss-120b」は「従量課金プラン」の契約が必要になります。

プラン選択画面

もし「利用可能なモデル」の一覧に「Weblab-MedLLM-gpt-oss-120b」が表示されない際は、「プラン」が「従量課金プラン」になっていることを確認しましょう。

※契約時のデフォルトのプランは「基盤モデル無償プラン」になっています。

Playgroundで自モデルを説明させる

そのままPlaygroundで「Weblab-MedLLM-gpt-oss-120b」で「gpt-oss-120bとあなたのモデルの違いを説明して」と入力したのですが・・・・自認はGPT‑4/ChatGPTになっているようです。

「gpt-oss-120bとあなたのモデルの違いを説明して」と入力した際の回答

医師国家試験問題の回答をさせる

さらに医療系の知識を活かせる問として、医師国家試験の回答をしてもらいました。

第120回医師国家試験問題および正答について|厚生労働省

上記厚生労働省のサイトから「A問題」の問題を25問抜粋・テキスト化し、「Weblab-MedLLM-gpt-oss-120b」「gpt-oss-120b」にそれぞれ回答をさせた上で、正答率を出してみます。

以下は第120回医師国家試験の公開問題です。 各問題の指示に従い、a〜eから適切な選択肢を選んでください。
・指定がない問題は1つ選んでください。 ・「2つ選べ」とある問題は、必ず2つ選んでください。 ・時点や地域の指定がある場合は、日本の2026年2月の試験時点を基準にしてください。 ・英語の問題も、回答理由は日本語で記載してください。
回答は次の表形式にしてください。 問題番号 | 回答(a〜e) | 簡潔な理由

モデル正解数不正解数正答率
Weblab-MedLLM-gpt-oss-120b22/25問3問88%
gpt-oss-120b21/25問4問84%

今回の25問の検証では、Weblab-MedLLM-gpt-oss-120bが88%、gpt-oss-120bが84%となり、Weblab-MedLLM-gpt-oss-120bが1問上回りました。ただし、問題数が25問と少なく、生成AIは回答が変動する場合もあるため、この結果だけで両モデルの性能差を断定することはできません。今後、問題数を増やして検証すると傾向がより明確になるかもしれません。

さいごに

医療データの活用や医療関連アプリケーション、業務支援システムなどの研究・検証用途では、医療分野向けに追加学習されたWeblab-MedLLM-gpt-oss-120bは興味深い選択肢になりそうです。

なお、本モデルは診断や治療方針の決定など、医療行為への直接利用を目的としたものではありません。実際の医療用途で利用する際は、公式の注意事項も確認してください。

さいごまでお読みいただき、ありがとうございました!

この記事を書いた人

UOZU

ネットアシスト運用チーム10年目の運用エンジニア

さくらのクラウド検定 ベーシック (第一回)

さくらのクラウド検定 アドバンスド (第一回)

AWS Certified Solutions Architect - Associate

AWS Certified AI Practitioner