このリポジトリの要約はプレプリントとしても公開されています: Exploring Open Large Language Models for the Japanese Language: A Practical Guide
日本語LLMまとめ
Snapshot 2026-08-03 23:56:39 UTC · version 1
Research document
日本語LLMまとめ
📖 より読みやすいWeb版をご利用ください
このREADMEの内容は、llm-jp.github.io/awesome-japanese-llm でより見やすい形式でご覧いただけます。表の表示崩れやレイアウトの問題を防ぐため、Web版の閲覧を推奨いたします。
この記事は、一般公開されている日本語LLM(日本語を中心に学習されたLLM)および日本語LLM評価ベンチマークに関する情報をまとめたものです。情報は、有志により収集されており、その一部は論文や公開されているリソースなどから引用しています。
::: warning 以下の点について、あらかじめご理解とご了承をお願いいたします
- 本記事の内容は、完全性や正確性を保証するものではありません。これらの情報は予告なく変更されることがあり、また最新の情報を常に提供できるとは限りません。
- 一部の情報は、推測や個々の利用者の解釈にもとづくものである場合があります。そのため、全ての読者にとって必ずしも正確であるとは限りません。
- 本記事に記載されているモデルの多くは、MIT や Apache-2.0 といったオープンソースライセンスが適用されています。しかしながら、一部のモデルには、非営利限定のライセンス(例:CC BY-NC-SA 4.0)や開発元特有のライセンスが適応されており、これらは必ずしもオープンソースとは言えない可能性がある点にご注意ください。
- 個人が開発したモデルに関する記述では、作成者の敬称は省略させていただいております。 :::
この記事の管理は GitHub で行っています。記事の間違いを発見した場合、あるいはモデルの追加提案を行いたい場合は、GitHub Issues 経由で報告していただけますと幸いです。
::: details 目次 {open} [[toc]] :::
テキスト生成に主に使うモデル
画像を含むテキスト生成モデルはこちら
スクラッチ学習モデル
汎用
| 公開年 | アーキテクチャ | 入出力で扱える トークン数 |
学習テキスト | 開発元 | ライセンス / 利用規約 | |
|---|---|---|---|---|---|---|
| Sarashina2-8x70B | 2024 | MoE (8x70b (465b)) |
8,192 | Sarashina2 (70B) に対して Sparse Upcycling で学習 | SB Intuitions | Sarashina Model NonCommercial License |
| LLM-jp-3 172B | 2024 | Llama (172b, 172b-instruct2, 172b-instruct3) |
4,096 | 事前学習: llm-jp-corpus-v3 (計 2.1T トークン) Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k DPO (instruct3 only): aya-ja-evol-inst, ac-self-inst |
大規模言語モデル研究開発センター | 事前学習済みモデル: LLM-jp-3 172B Terms of Use 事後学習済みモデル: llm-jp-3-172b-instruct3利用許諾契約 |
| LLM-jp-3 172B beta2 | 2024 | Llama (172b-beta2, 172b-beta2-instruct2) |
4,096 | 事前学習: llm-jp-corpus-v3の一部 (計 1.4T トークン) Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k |
大規模言語モデル研究開発センター | LLM-jp-3 172B beta2 Terms of Use |
| LLM-jp-3 172B beta1 | 2024 | Llama (172b-beta1, 172b-beta1-instruct) |
4,096 | 事前学習: llm-jp-corpus-v3の一部 (計 0.7T トークン) Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2, Aya Dataset, ichikara-instruction-format, Daring-Anteater, FLAN |
大規模言語モデル研究開発センター | LLM-jp-3 172B beta1 Terms of Use |
| LLM-jp-3 172B alpha | 2024 | Llama (172b-alpha1, 172b-alpha1-instruct, 172b-alpha2, 172b-alpha2-instruct) |
4,096 | 事前学習: llm-jp-corpus-v3の一部 (alpha1: 計 0.7T トークン, alpha2: 計 1.4T トークン) Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2, Aya Dataset, ichikara-instruction-format, Daring-Anteater, FLAN |
大規模言語モデル研究開発センター | Apache 2.0 |
| Stockmark-2-100B-Instruct-beta | 2025 | Llama (100B-Instruct-beta, 100B-Instruct-beta-AWQ) |
4,096 | 事前学習: 計 1.5T トークン Instruction Tuning DPO |
ストックマーク | MIT |
| Stockmark-100b | 2024 | Llama (100b, 100b-instruct-v0.1) |
4,096 | 事前学習: RedPajama, 日本語 Wikipedia, Japanese mC4, Japanese CommonCrawl, 日本語特許, Stockmark Web Corpus (計 910B トークン) Instruction Tuning (LoRA): ichikara-instruction |
ストックマーク | MIT |
| PLaMo-100B-Pretrained | 2024 | Llama[^22] (100b) |
4,096 | 事前学習: Japanese CommonCrawl, RefinedWeb, 独自のデータセット (計: 2.0T トークン) |
Preferred Elements (Preferred Networks) | PLaMo Non-Commercial License |
| LLM-jp-3.1 | 2025 | Llama/MoE (8x13b (73b), 8x13b (73b)-instruct4, 13b, 13b-instruct4, 1.8b, 1.8b-instruct4) |
4,096 | 事前学習: llm-jp-corpus-v3 (計 2.5T トークン) 継続事前学習: インストラクション・レスポンスペア (計 90B トークン) SFT + DPO |
大規模言語モデル研究開発センター | Apache 2.0 |
| LLM-jp-3 MoE | 2025 | MoE (8x1.8b (9.3b), 8x1.8b (9.3b)-instruct2, 8x1.8b (9.3b)-instruct3, 8x13b (73b), 8x13b (73b)-instruct2, 8x13b (73b)-instruct3) |
4,096 | LLM-jp-3 (1.8b, 13b) に対して Drop-Upcycling で学習 | 大規模言語モデル研究開発センター | Apache 2.0 |
| Sarashina2 | 2024 | Llama (7b, 13b, 70b) |
7b, 13b: 4,096 70b: 8,192 |
事前学習: Japanese Common Crawl, SlimPajama, StarCoder (計 2.1T トークン) |
SB Intuitions | MIT |
| Sarashina1 | 2024 | GPT-NeoX (7b, 13b, 65b) |
2,048 | 事前学習: Japanese Common Crawl (計 1T トークン) |
SB Intuitions | MIT |
| Tanuki-8×8B | 2024 | MoE (47b) (v1.0, v1.0-AWQ, v1.0-GPTQ-4bit, v1.0-GPTQ-8bit, v1.0-GGUF) |
4,096 | 事前学習: 様々な Web 上のデータ, 合成データ(計 1.7T トークン) SFT, DPO: 様々な合成データ [^19] |
松尾研LLM開発プロジェクト | Apache 2.0 |
| LLM-jp-4 32B-A3B | 2026 | Qwen3 MoE (32b-a3b-base, 32b-a3b-thinking, 32b-a3b-thinking-gguf) |
65,536 | 事前学習 + 中間学習: llm-jp-corpus-v4.1, llm-jp-corpus-midtraining-v2 (計 11.7T トークン) SFT: llm-jp-4-thinking-sft-data DPO: llm-jp-4-32b-a3b-thinking-dpo-data |
大規模言語モデル研究開発センター | Apache 2.0 |
| llm-jp-4-kappa | 2026 | Qwen3 MoE (32b-a3b-v0.1) |
65,536 | LLM-jp-4 32B-A3B (thinking) に対して以下を実施 SFT: Nemotron-Cascade-2-SFT-Data, OpenMathReasoning, OpenCodeReasoning, Nemotron-SFT-Competitive-Programming-v2, llm-jp-4-thinking-sft-data など (計 443,747 件) GRPO (数学): AceReason-Math から選別した 10,999 問 GRPO (コード): SYNTHETIC-2 から選別した約 3.1k 件 |
Third Intelligence | Apache 2.0[^29] |
| PLaMo 3 | 2025 | Gemma ベースのアーキテクチャ (2b-base, 8b-base, 31b-base) |
4,096 | 事前学習: 英語、日本語、コード、多言語 (2b: 200B トークン, 8b: 1T トークン, 31b: 3T トークン) |
Preferred Networks | PLaMo community license |
| Way-PLaMo-3-8b-chat | 2025 | PLaMo 3ベース (8b-chat) | 4,096 | Instruction Following SFT: Alpaca (51.7K), Dolly-15k-ja (15K) | 個人 (WayBob) | PLaMo community license |
| CyberAgentLM3 (CALM3) | 2024 | Llama (22b-chat, 22b-chat-selfimprove-experimental) |
16,384 | 不明 (計 2.0T トークン) |
サイバーエージェント | Apache 2.0 |
| LLM-jp-3 13B instruct3 | 2025 | Llama (150m, 150m-instruct2, 150m-instruct3, 440m, 440m-instruct2, 440m-instruct3, 980m, 980m-instruct2, 980m-instruct3, 1.8b-instrcut2, 1.8b-instruct3, 3.7b-instruct2, 3.7b-instruct3, 7.2b-instruct2, 7.2b-instruct3, 13b-instruct2, 13b-instruct3) |
4,096 | 事前学習: llm-jp-corpus-v3 (計 2.1T トークン) Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, Synthetic-JP-EN-Coding-Dataset-567k DPO (instruct3 only): aya-ja-evol-inst, ac-self-inst |
大規模言語モデル研究開発センター | Apache 2.0 |
| LLM-jp-3 13B | 2024 | Llama (1.8b, 1.8b-instruct, 3.7b, 3.7b-instruct, 7.2b, 7.2b-instruct, 13b, 13b-instruct) |
4,096 | 事前学習: llm-jp-corpus-v3 (計 2.1T トークン) Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k |
大規模言語モデル研究開発センター | Apache 2.0 |
| llm-jp-3-3.7b-instruct-EZO | 2024 | Llama (3.7b-instruct-EZO-Common, 3.7b-instruct-EZO-Humanities) |
4,096 | LLM-jp-3 (3.7B) に対して追加学習 | Axcxept | Apache 2.0 |
| LLM-jp-13B v2.0 | 2024 | Llama (13b-v2.0, 13b-instruct-full-dolly-ichikara_004_001_single-oasst-oasst2-v2.0, 13b-instruct-full-ac_001-dolly-ichikara_004_001_single-oasst-oasst2-v2.0, 13b-instruct-full-ac_001_16x-dolly-ichikara_004_001_single-oasst-oasst2-v2.0) |
4,096 | 事前学習: llm-jp-corpus-v2 (計 260B トークン) Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2 |
LLM-jp | Apache 2.0 |
| Fugaku-LLM | 2024 | GPT (13B, 13B-instruct, 13B-instruct-gguf) |
2,048 | 事前学習: 独自 Instruction Tuning: OASST1, Dolly Dataset, GSM8K |
東工大, 東北大, 富士通, 理研, 名大, サイバーエージェント, Kotoba Technologies | Fugaku-LLM Terms of Use |
| LLM-jp-13B v1.1 | 2024 | GPT (13b-instruct-lora-dolly_en-dolly_ja-ichikara_003_001-oasst_en-oasst_ja-v1.1, 13b-instruct-full-dolly_en-dolly_ja-ichikara_003_001-oasst_en-oasst_ja-v1.1, 13b-dpo-lora-hh_rlhf_ja-v1.1) |
2,048 | Instruction Tuning (LoRA or Full-parameter FT): Dolly Dataset, OASST1, ichikara-instruction DPO (LoRA): HH RLHF |
LLM-jp | Apache 2.0 |
| LLM-jp-13B | 2023 | GPT (1.3b-v1.0, 13b-v1.0, 13b-instruct-full-jaster-v1.0, 13b-instruct-full-jaster-dolly-oasst-v1.0, 13b-instruct-full-dolly-oasst-v1.0, 13b-instruct-lora-jaster-v1.0, 13b-instruct-lora-jaster-dolly-oasst-v1.0, 13b-instruct-lora-dolly-oasst-v1.0) |
2,048 | 事前学習: llm-jp-corpus (Wikipedia, Japanese mC4, The Pile, Stack) (計 300B トークン) Instruction Tuning (Full-parameter FT or LoRA): jaster, Dolly Dataset, OASST1 |
LLM-jp | Apache 2.0 |
| PLaMo-13B | 2023 | Llama[^1] (13b, 13b-instruct, 13b-instruct-nc) |
base: 4,096 instruct, instruct-nc: 8,192 |
事前学習: C4, Project Gutenberg, RedPajama, 日本語 Wikipedia, Japanese mC4 (計 1.5T トークン) Instruction Tuning: Dolly Dataset, HH RLHF, OASST1, llm-japanese-datasetのwikinews subset (NCモデルでは商用利用不可の Alpaca Dataset も含めて学習) |
Preferred Networks | Apache 2.0 (NC モデルは CC BY-NC 4.0) |
| Stockmark-13b | 2023 | Llama (13b, 13b-instruct) |
2,048 | 事前学習: 日本語 Wikipedia、Japanese CC-100、Japanese mC4、Japanese CommonCrawl、日本語特許、Stockmark Web Corpus (計 220B トークン) Instruction Tuning (LoRA): ichikara-instruction |
ストックマーク | baseモデル: MIT instructモデル: CC BY-NC-SA 4.0 |
| Weblab-10B | 2023 | GPT-NeoX (10b, 10b-instruction-sft) |
2,048 | Japanese mC4 + The Pile(計 600B トークン) *instruction-sft モデルは Alpaca Dataset, FLAN でファインチューニング |
東大 松尾・岩澤研 | CC BY-NC 4.0 |
| LLM-jp-4 8B | 2026 | Llama (8b-base, 8b-instruct, 8b-thinking, 8b-thinking-gguf) |
65,536 | 事前学習 + 中間学習: llm-jp-corpus-v4.1, llm-jp-corpus-midtraining-v2 (計 11.7T トークン) SFT: llm-jp-4-thinking-sft-data DPO (thinking のみ): llm-jp-4-8b-thinking-dpo-data |
大規模言語モデル研究開発センター | Apache 2.0 |
| PLaMo 2.1 8B | 2025 | Samba ベースのアーキテクチャ (8b-cpt) |
32,768 | 訓練詳細不明 | Preferred Networks | PLaMo community license |
| PLaMo 2 8B | 2025 | Samba ベースのアーキテクチャ (8b) |
日本語、英語等のデータ (計 6T トークン) |
Preferred Networks | PLaMo community license | |
| Tanuki-8B | 2024 | Tanuki (8b) (v1.0, v1.0-AWQ, v1.0-GPTQ-4bit, v1.0-GPTQ-8bit, v1.0-GGUF) |
4,096 | 事前学習: 様々な Web 上のデータ, 合成データ(計 1.3T トークン) SFT, DPO: 様々な合成データ [^19] |
松尾研LLM開発プロジェクト | Apache 2.0 |
| Japanese StableLM Alpha | 2023 | GPT-NeoX (base-alpha-7b, instruct-alpha-7b, instruct-alpha-7b-v2) |
2,048 | Wikipedia, Japanese CC-100, Japanese mC4, Japanese OSCAR, RedPajama (+ 独自のデータセット)[^2] (計 750B トークン) *instruct モデルでは Alpaca Dataset, Dolly Dataset, HH RLHF, llm-japanese-datasetのwikinews subsetでファインチューニング (v2では商用利用不可の Alpaca Dataset を除外) |
Stability AI | baseモデル: Apache 2.0 instruct モデル (v1): 独自のライセンス instruct モデル (v2): Apache 2.0 |
| CyberAgentLM2 (CALM2) | 2023 | Llama (7b, 7b-chat, 7b-chat-dpo-experimental) |
base: 4,096 chat: 32,768 |
一般公開されている日本語・英語のデータセット(詳細不明) (計 1.3T トークン) *dpo モデルは Chatbot Arena Conversations JA (calm2) Dataset を用いて DPO で学習 |
サイバーエージェント | Apache 2.0 (dpo モデルのみ CC BY 4.0) |
| OpenCALM | 2023 | GPT-NeoX (small, medium, large, 1b(1.4b), 3b(2.7b), 7b(6.8b)) |
2,048 | 日本語 Wikipedia + Jpanese mC4 + Japanese CC-100 |
サイバーエージェント | CC BY-SA 4.0 |
| Stormy | 2023 | GPT-NeoX (7b(6.8b)) |
2,048 | OpenCALM (6.8b) に対して llm-japanese-dataset v0 のうち翻訳タスクを除いたデータで LoRAチューニング |
東大 和泉研 | CC BY-SA 4.0 |
| ByGPT-JP | 2025 | Llama ベース (multi-lm-head-6.5b-alpha) |
5,760 | llm-jp-corpus-v3 のサブセット (ja_cc, ja_warp_html, ja_warp_pdf, ja_wiki, kaken) | 東北大 自然言語処理研究グループ |
Apache 2.0 |
| rinna GPT (英語やコードも含めて学習されたモデル) |
2023 | GPT-NeoX (4b(3.8b), 4b(3.8b)-8k, 4b(3.8b)-instruction-sft, 4b(3.8b)-instruction-ppo) |
8kモデル: 8,192 他: 2,048 |
Wikipedia, Japanese CC-100, Japanese C4, RedPajama, The Pile (計 524B トークン) *8k モデルでは 4,000トークンを超える長いトークン列でファインチューニング *instruction-sft モデルでは HH RLHF、FLAN でファインチューニング *instruction-ppo モデルでは HH RLHF で PPO ベースの強化学習 |
rinna | MIT |
| japanese-large-lm | 2023 | GPT-NeoX (1.7b, 3.6b, 1.7b-instruction-sft, 3.6b-instruction-sft) |
2,048 | 日本語 Wikipedia, Japanese CC-100, Japanese C4, Japanese OSCAR や独自データなど (計 650GB) *instruction-sft モデルでは OASST1 でファインチューニング |
LINE | Apache 2.0 |
| rinna GPT (日本語のみで学習されたモデル) |
2023 | GPT または GPT-NeoX (xsmall, small, medium, 1b, neox-small, neox-3.6b-instruction-sft-v2, neox-3.6b-instruction-ppo) |
≤ 2,048 | 日本語 Wikipedia + Japanese CC-100 (1b 以降のモデルでは さらに Japanese mC4 を追加) *instruction-sft, sft-v2 モデルでは HH RLHF、FLAN、SHP データセットでさらにファインチューニング *instruction-ppo モデルでは HH RLHF でさらに PPO ベースの強化学習 |
rinna | MIT |
| Sarashina2.2 | 2025 | Llama (0.5b, 0.5b-instruct-v0.1, 1b, 1b-instruct-v0.1, 3b, 3b-instruct-v0.1) |
8,192 | SB Intuitions | MIT | |
| レトリバT5 | 2023 | T5 (small (short), small (medium), small (long), base (short), base (medium), base (long), large (short), large (medium), large (long), xl(3b)) |
日本語 Wikipedia + Japanese mC4 | レトリバ | CC BY-SA 4.0 | |
| Spiral-RetNet-3b-base | 2024 | RetNet (3b) |
2,048 | Wikipedia, Japanese CC-100, CulturaX | Spiral.AI | MIT |
| kotomamba-2.8B | 2024 | Mamba (2.8B-v1.0) |
2,048 | 日本語 Wikipedia, Swallow Corpus, SlimPajama | Kotoba Technologies | Apache 2.0 |
| ABEJA GPT | 2022 | GPT または GPT-NeoX (large, neox-2.7b) |
日本語 Wikipedia + Japanese CC-100 + Japanese OSCAR |
ABEJA | MIT | |
| PLaMo 2.1 2B | 2025 | Causal decoder-only transformer (2b-cpt) |
32,768 | 訓練詳細不明 | Preferred Networks | PLaMo community license |
| Rakuten AI 2.0 mini | 2025 | Mistral (mini(1.5b), mini(1.5b)-instruct) |
131,072 | 楽天 | Apache 2.0 | |
| 早大GPT | 2022 | GPT (small, xl(1.5b)) |
日本語 Wikipedia + Japanese CC-100 |
早大 河原研 | CC BY-SA 4.0 | |
| ストックマークGPT | 2023 | GPT-NeoX (1.4b) |
日本語 Wikipedia (0.88B トークン) + Japanese CC-100 (10.5B トークン) + 独自のWebデータ (8.6B トークン) |
ストックマーク | MIT | |
| イエローバックGPT | 2021 | GPT-NeoX (1.3b) |
日本語 Wikipedia + Japanese CC-100 + Japanese OSCAR |
イエローバック | Apache 2.0 | |
| PLaMo 2 1B | 2025 | Samba ベースのアーキテクチャ (1b) |
日本語、英語等のデータ (計 4T トークン) |
Preferred Elements (Preferred Networks) | Apache 2.0 | |
| Sarashina2.1-1B | 2024 | Llama (1b) |
8,192 | Web 上などの日本語・英語データ(計 10T トークン) | SB Intuitions | Sarashina Model NonCommercial License |
| colorfulscoop GPT | 2021 | GPT (small) |
日本語 Wikipedia | Colorful Scoop | CC BY-SA 3.0 | |
| 東工大GPT | 2023 | GPT (medium, medium (逆方向)) [^3] |
日本語 Wikipedia + Japanese CC-100 | 東工大 岡崎研 | CC BY-SA 4.0 | |
| 京大GPT | 2022 | GPT (small (文字レベル), medium (文字レベル), large (文字レベル)) |
日本語 Wikipedia (約2,700万文 (3.2GB)) + Japanese CC-100 (約6億1,900万文 (85GB)) + Japanese OSCAR (約3億2,600万文 (54GB)) |
京大 言語メディア研究室 | CC BY-SA 4.0 | |
| 日本語BART | 2023 | BART (base, large) |
日本語 Wikipedia (約1,800万文) | 京大 言語メディア研究室 | CC BY-SA 4.0 | |
| Megagon Labs T5 | 2021 | T5 (base) |
Japanese mC4 (87,425,304 ページ (782 GB)) + Japanese wiki40b (828,236 記事 (2 GB)) |
Megagon Labs (リクルート) |
Apache 2.0 |
ドメイン特化型
| 公開年 | ドメイン | アーキテクチャ | 学習テキスト | 開発元 | ライセンス | |
|---|---|---|---|---|---|---|
| SIP-med-LLM/SIP-jmed-llm-3-8x13b-OP-32k-R0.1 | 2026 | 医療 | MoE | 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 Instruction Tuning | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] |
| SIP-med-LLM/SIP-jmed-llm-3-8x13b-AC-32k-instruct | 2025 | 医療 | MoE | 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 PMC-Patients 等を用いた Instruction Tuning | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | SIP-jmed-llm-3-8x13b-AC-32k-instruct Terms of Use[^25] |
| SIP-med-LLM/SIP-jmed-llm-3-8x13b-OP-4k-base | 2025 | 医療 | MoE | 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習 | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] |
| SIP-med-LLM/SIP-jmed-llm-2-8x13b-OP-instruct | 2025 | 医療 | MoE | 医療系コーパス (44.2B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、その後 Instruction Tuning | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] |
| SIP-med-LLM/SIP-jmed-llm-3-13b-OP-32k-R0.1 | 2026 | 医療 | Llama | 医療系コーパス (78.3B トークン) で LLM-jp-3.1 (13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 Instruction Tuning | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] |
| SIP-med-LLM/SIP-jmed-llm-3-13b-OP-4k-base | 2025 | 医療 | Llama | 医療系コーパス (78.3B トークン) で LLM-jp-3.1 (13b) に追加事前学習 | 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ | Apache 2.0[^25] |
| AscleLM-1-10B | 2026 | 医療 | Mamba-2 Hybrid (Nemotron-H ベース) |
事前学習: Nemotron-CC v1 (約 6.3T トークン)、オープンソースの日本語・英語・中国語コーパス、コード・数学・推論データ (計 約 8.5T トークン)、および医学論文・医学書籍・診療ガイドライン・試験問題を由来とする合成データ | 東大 松尾・岩澤研 | AscleLM-1-10B Terms of Use[^27] |
| 日本語対話Transformer | 2021 | 対話 | Transformer | Twitter 上の日本語リプライのペア | NTT | 独自のライセンス |
| 日本語ニュースBART | 2023 | ビジネス | BART (base) | 日本語ビジネスニュース記事(約2,100万記事 (2.9億文)) | ストックマーク | MIT |
| AcademicBART | 2023 | 学術 | BART (base) | CiNii の日本語論文 | 愛媛大 人工知能研究室 | Apache 2.0 |
海外モデルに日本語で継続事前学習を行ったモデル
※継続事前学習後に事後学習(SFT, DPO, RLなど)を行ったモデルも含みます
汎用
| 公開年 | ベースのLLM | 学習テキスト | 開発元 | ライセンス / 利用規約 | |
|---|---|---|---|---|---|
| GPT-OSS Swallow 120B (120B-SFT-v0.1, 120B-RL-v0.1, 120B-RL-v0.1-MXFP4) |
2026 | GPT-OSS (120b) | 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2 (計 419.4B トークン) SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1 RL: allenai/Dolci-Think-RL-7B (Math subset) |
Swallowプロジェクト | Apache 2.0 |
| Llama 3.3 Swallow 70B (70B-v0.4, 70B-Instruct-v0.4) |
2025 | Llama 3.3 (70b) | 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3 Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1, Swallow-Code-v0.3-Instruct-style |
Swallowプロジェクト | Llama 3.3 Community License & Gemma Terms of Use |
| Llama 3.1 Swallow 70B (70B-v0.1, 70B-Instruct-v0.1, 70B-Instruct-v0.3) |
2024 | Llama 3.1 (70b) | 事前学習: The Stack v2, Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus Instruction Tuning: lmsys-chat-1m-synth-ja-wo-pii-and-template-instructions, lmsys-chat-1m-synth-en-wo-pii-and-template-instructions, filtered-magpie-ultra-ja, filtered-magpie-ultra-en, gemma-magpie |
Swallowプロジェクト | Llama 3.1 Community License (Instructモデルは Gemma Terms of Use も適用) |
| cyberagent/Llama-3.1-70B-Japanese-Instruct-2407 | 2024 | Llama 3.1 (70b) | 不明 | サイバーエージェント | Llama 3.1 Community License |
| Llama 3 Swallow 70B (70B-v0.1, 70B-Instruct-v0.1) |
2024 | Llama 3 (70b) | 事前学習: Algebraic Stack, Wikipedia, RefinedWeb, Swallow Corpus, Cosmopedia, Laboro ParaCorpus, OpenWebMath Instruction Tuning: OASST1 [^17] |
Swallowプロジェクト | Llama 3 Community License |
| turing-motors/Llama-3-heron-brain-70B-v0.3 | 2024 | Llama 3 (70b) | Llama 3 Swallow 70B に対して追加学習(詳細不明) | Turing | Llama 3 Community License |
| Llama 3 Youko 70B (70b, 70b-instruct, 70b-gptq, 70b-instruct-gptq) |
2024 | Llama 3 (70b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット (計 5B トークン) Instruction Tuning: 独自のデータセット[^11] |
rinna | Llama 3 Community License |
| Swallow 70B (70b-hf, 70b-instruct-hf, 70b-instruct-v0.1, 70b-NVE-hf, 70b-NVE-instruct-hf) |
2023 | Llama 2 (70b) | 事前学習: 日本語 Wikipedia, RefinedWeb, Swallow Corpus, The Pile Instruction Tuning: Dolly Dataset, HH RLHF, OASST1 *v0.1モデルでは OASST1, OASST2 を使用 |
Swallowプロジェクト | Llama 2 Community License |
| KARAKURI LM (70b-v0.1, 70b-chat-v0.1) |
2024 | Llama 2 (70b) | 事前学習: mC4, CC100, OSCAR, RedPajama, 独自のデータセット (計 16B トークン) SteerLM: OASST2, 独自のデータセット |
カラクリ | Llama 2 Community License[^13] |
| Japanese Stable LM Beta 70B (base-beta-70b, instruct-beta-70b) |
2023 | Llama 2 (70b) | 事前学習: Wikipedia, Japanese mC4, Japanese CC-100, Japanese OSCAR, SlimPajama(Books3を除外) (計 100B トークン) Instruction Tuning: Dolly Dataset, HH RLHF, OASST1 |
Stability AI | Llama 2 Community License |
| Fujitsu-LLM-KG (8x7B_cpt, 8x7B_inst-infer_v1, 8x7B_inst-infer_v2, 8x7B_inst-gen_ja, 8x7B_inst-gen_en) |
2025 | Mixtral-8x7B-Instruct-v0.1 (46.7b) | 事前学習: 知識グラフ並列コーパス(森羅プロジェクト、Wikipedia等から合成) 2.1Bトークンを含む計約300Bトークン Instruction Tuning: 知識グラフ推論・生成タスク用データセット |
富士通 | Apache 2.0 |
| Swallow-MX 8x7B (8x7b-NVE-v0.1) |
2024 | Mixtral-8x7B-Instruct-v0.1 (46.7b) | 事前学習: Algebraic Stack, Japanese Wikipedia, RefinedWeb, Swallow Corpus, The Pile, The Vault | Swallowプロジェクト | Apache 2.0 |
| KARAKURI LM 8x7B Instruct v0.1 (8x7b-instruct-v0.1) |
2024 | Mixtral-8x7B-Instruct-v0.1 (46.7b) | Swallow-MX 8x7B に対して以下のデータセットで学習: Dolly Dataset, OASST2, HelpSteer, glaive-code-assistant-v3, glaive-function-calling-v2, synthetic_text_to_sql, MetaMathQA, orca-math-word-problems-200k, rag-dataset-12000, rag-hallucination-dataset-1000, 独自のデータセット | カラクリ | Apache 2.0 (?)[^12] |
| KARAKURI LM 8x7B Chat v0.1 (8x7b-chat-v0.1) |
2024 | Mixtral-8x7B-Instruct-v0.1 (46.7b) | Swallow-MX 8x7B に対して SteerLM: OASST2, HelpSteer, 独自のデータセット |
カラクリ | Apache 2.0 |
| ABEJA-Mixtral-8x7B-japanese (8x7B-v0.1-japanese, 8x7B-Instruct-v0.1-japanese, 8x7B-Instruct-v0.1-japanese-alpha, 8x7B-Instruct-v0.1-japanese-alpha-merged) |
2024 | Mixtral-8x7B-Instruct-v0.1 (46.7b) *Instructが名前に付いていないモデルのみ Mixtral-8x7B-v0.1 がベース |
事前学習: Japanese CC, Redpajama, 独自 (計 450B トークン) |
ABEJA | Apache 2.0 |
| Qwen3 Swallow 32B (32B-CPT-v0.2, 32B-SFT-v0.2, 32B-RL-v0.2, 32B-RL-v0.2-AWQ-INT4) |
2026 | Qwen3 (32b) | 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2 (計 209.7B トークン) SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1 RL: allenai/Dolci-Think-RL-7B (Math subset) |
Swallowプロジェクト | Apache 2.0 |
| ELYZA-Thinking-1.0-Qwen-32B (32B) |
2025 | Qwen 2.5 (32b) | 事前学習 + SFT (Reasoning) | ELYZA | Apache 2.0 |
| ELYZA-Shortcut-1.0-Qwen-32B (32B) |
2025 | Qwen 2.5 (32b) | 事前学習 + SFT | ELYZA | Apache 2.0 |
| ABEJA-Qwen2.5-32b-Japanese-v1.0 (v1.0) |
2025 | Qwen2.5-32B-Instruct (32b) | 継続事前学習 + SFT + DPO: 約2万件の合成データ・人手アノテーションデータセット(抽出・推論能力に特化) | ABEJA | Apache 2.0 |
| Qwen2.5 Bakeneko 32B (qwen2.5-bakeneko-32b, qwen2.5-bakeneko-32b-instruct, deepseek-r1-distill-qwen2.5-bakeneko-32b, qwq-bakeneko-32b) |
2025 | Qwen 2.5 (32b) | rinna | Apache 2.0 | |
| ABEJA-QwQ32b-Reasoning-Japanese-v1.0 (v1.0) |
2025 | Qwen 2.5 (32b) | ABEJA-Qwen2.5-32b-Japanese-v0.1 に QwQ 32b の Chat Vector をマージした上で追加学習 | ABEJA | Apache 2.0 |
| ABEJA-Qwen2.5-32b-Japanese-v0.1 (32b-Japanese-v0.1) |
2025 | Qwen 2.5 (32b) | 事前学習: Common Crawl, Cosmopedia, 独自 (計 100B トークン) + Chat Vector |
ABEJA | Apache 2.0 |
| neoAI-JP-QwQ-32B (32B) |
2025 | Qwen 2.5 (32b) | 継続事前学習: llm-jp-corpus v3から約4Bトークン + QwQ-32BのChat Vector |
neoAI | Apache 2.0 |
| neoAI-JP-DeepSeek-Qwen-32B (32B) |
2025 | Qwen 2.5 (32b) | 継続事前学習: llm-jp-corpus v3から約4Bトークン + DeepSeek-R1-Distill-Qwen-32BのChat Vector |
neoAI | Apache 2.0 |
| Qwen3 Swallow 30B-A3B (30B-A3B-CPT-v0.2, 30B-A3B-SFT-v0.2, 30B-A3B-RL-v0.2, 30B-A3B-RL-v0.2-AWQ-INT4) |
2026 | Qwen3 (30b-A3B) | 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2 (計 209.7B トークン) SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1 RL: allenai/Dolci-Think-RL-7B (Math subset) |
Swallowプロジェクト | Apache 2.0 |
| Gemma-2-Llama Swallow 27B (27b-pt-v0.1, 27b-it-v0.1) |
2025 | Gemma 2 (27b) | 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3 Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1 |
Swallowプロジェクト | Llama 3.3 Community License & Gemma Terms of Use |
| GPT-OSS Swallow 20B (20B-SFT-v0.1, 20B-RL-v0.1, 20B-RL-v0.1-MXFP4) |
2026 | GPT-OSS (20b) | 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2 (計 419.4B トークン) SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1 RL: allenai/Dolci-Think-RL-7B (Math subset) |
Swallowプロジェクト | Apache 2.0 |
| ABEJA-Qwen3-14B-Agentic-256k-v0.1 (v0.1) |
2026 | Qwen3 (14b) | 継続事前学習: 長文合成データ(YaRN によりコンテキスト長を128k→256kに拡張) + Agentic 能力強化のための強化学習 |
ABEJA | Apache 2.0 |
| Nekomata 14B (14b, 14b-instruction, 14b-gguf, 14b-instruction-gguf) |
2023 | Qwen (14b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット (計 66B トークン) Instruction Tuning: Dolly Dataset, FLAN, llm-japanese-datasetの一部 |
rinna | Tongyi Qianwen LICENSE |
| Swallow 13B (13b-hf, 13b-instruct-hf, 13b-instruct-v0.1, 13b-NVE-hf) |
2023 | Llama 2 (13b) | 事前学習: 日本語 Wikipedia, RefinedWeb, Swallow Corpus, The Pile Instruction Tuning: Dolly Dataset, HH RLHF, OASST1 *v0.1モデルでは OASST1, OASST2 を使用 |
Swallowプロジェクト | Llama 2 Community License |
| LEIA-Swallow-13B (13b) |
2024 | Llama 2 (13b) | Swallow 13B に対して LEIA で追加学習 | 個人 (山田育矢, 李凌寒) | Llama 2 Community License |
| ELYZA-japanese-Llama-2-13b (13b, 13b-instruct, 13b-fast, 13b-fast-instruct) |
2023 | Llama 2 (13b) | 事前学翕: 日本語 Wikipedia, Japanese OSCAR, その他クロールデータなど (計 18B トークン) Instruction Tuning: 独自のデータセット |
ELYZA | Llama 2 Community License |
| cyberagent/Mistral-Nemo-Japanese-Instruct-2408 | 2024 | Mistral NeMo (12b) | 不明 | サイバーエージェント | Apache 2.0 |
| NVIDIA-Nemotron-Nano-9B-v2-Japanese (9B) |
2026 | Nemotron-Nano (9b) | 継続事前学習: Wikipedia, fineweb-2 Japanese, aozorabunko, sip3-ja-general-web-corpus, Nemotron-CC-v2.1, Nemotron-Pretraining-Specialized-v1 SFT: Nemotron-Personas-Japan をシードセットとした Tool Calling データセット, Nemotron-Post-Training-v3 |
NVIDIA | NVIDIA Nemotron Open Model License Agreement |
| Gemma-2-Llama Swallow 9B (9b-pt-v0.1, 9b-it-v0.1) |
2025 | Gemma 2 (9b) | 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3 Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1 |
Swallowプロジェクト | Llama 3.3 Community License & Gemma Terms of Use |
| Qwen3 Swallow 8B (8B-CPT-v0.2, 8B-SFT-v0.2, 8B-RL-v0.2, 8B-RL-v0.2-AWQ-INT4) |
2026 | Qwen3 (8b) | 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2 (計 209.7B トークン) SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1 RL: allenai/Dolci-Think-RL-7B (Math subset) |
Swallowプロジェクト | Apache 2.0 |
| Llama 3.1 Swallow 8B (8B-v0.1, 8B-Instruct-v0.1, 8B-v0.2, 8B-Instruct-v0.2, 8B-Instruct-v0.3, 8B-Instruct-v0.5) |
2025 | Llama 3.1 (8b) | 事前学習: The Stack v2, Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus Instruction Tuning: lmsys-chat-1m-synth-ja-wo-pii-and-template-instructions, lmsys-chat-1m-synth-en-wo-pii-and-template-instructions, filtered-magpie-ultra-ja, filtered-magpie-ultra-en, gemma-magpie, Gemma-3-LMSYS-Chat-1M-Synth |
Swallowプロジェクト | Llama 3.1 Community License (Instructモデルは Gemma Terms of Use も適用) |
| Llama 3 Swallow 8B (8B-v0.1, 8B-Instruct-v0.1) |
2023 | Llama 3 (8b) | 事前学習: Algebraic Stack, Wikipedia, RefinedWeb, Swallow Corpus, Cosmopedia, Laboro ParaCorpus, OpenWebMath Instruction Tuning: OASST1 [^17] |
Swallowプロジェクト | Llama 3 Community License |
| turing-motors/Llama-3-heron-brain-8B-v0.3 | 2024 | Llama 3 (8b) | Llama 3 Swallow 8B に対して追加学習(詳細不明) | Turing | Llama 3 Community License |
| Llama 3 Youko 8B (8b, 8b-instruct, 8b-gptq, 8b-instruct-gptq) |
2024 | Llama 3 (8b) | 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット (計 22B トークン) Instruction Tuning[^11]: Aya Dataset (Japanese subset), FLAN, Dolly Dataset, HH RLHF, OASST1, OASST2, MetaMathQA, CodeAlpaca Dataset, 独自のデータセット DPO: HelpSteer, HelpSteer2, 独自のデータセット |
rinna | Llama 3 Community License |
| Llama 3 ELYZA JP 8B (8B, 8B-GGUF, 8B-AWQ) |
2024 | Llama 3 (8b) | 不明 | ELYZA | Llama 3 Community License |
| Llama 3 neoAI 8B Chat v0.1 (8B-Chat-v0.1) |
2024 | Llama 3 (8b) | 不明 | neoAI | Llama 3 Community License |
| Llama 3 tedllm (v0) |
2024 | Llama 3 (8b) | 事前学習: 日本語の一般コーパス | 東京エレクトロン デバイス | Llama 3 Community License |
| ELYZA-Shortcut-1.0-Qwen-7B (7B) |
2025 | Qwen 2.5 (7b) | 事前学習 + SFT | ELYZA | Apache 2.0 |
| ELYZA-Diffusion-1.0-Dream-7B (Base-7B, Instruct-7B) |
2026 | Dream (7b) | 事前学習: 日本語テキスト (約 62B トークン) Instruction Tuning: 日本語の指示データ (約 0.18B トークン) |
ELYZA | Apache 2.0 |
This HTML preview is truncated for page performance. The canonical Markdown file contains the complete snapshot.
Why MDRSS assigned this score
- Production catalog audit 2026-08-04
- Taxonomy classified from title, annotation, source and Markdown signals
- Agent usefulness evaluated from structure, procedures, examples, evidence and retrieval value
Discussion 0
Sign in to join the discussion.