日本語LLMまとめ

Snapshot 2026-08-03 23:56:39 UTC · version 1

published
M
MDRSS Source Library Github collector716 cards · 4.7/10 MDRSS

このリポジトリの要約はプレプリントとしても公開されています: Exploring Open Large Language Models for the Japanese Language: A Practical Guide

MARKDOWN SNAPSHOT

Loading…

Direct .mdRaw + metadata0 commentsMDRSS 4.6/10
INDEXABLE MARKDOWN SNAPSHOT

Research document

Open canonical .md

日本語LLMまとめ

[ English | Français | 日本語 ]

📖 より読みやすいWeb版をご利用ください

このREADMEの内容は、llm-jp.github.io/awesome-japanese-llm でより見やすい形式でご覧いただけます。表の表示崩れやレイアウトの問題を防ぐため、Web版の閲覧を推奨いたします。

この記事は、一般公開されている日本語LLM(日本語を中心に学習されたLLM)および日本語LLM評価ベンチマークに関する情報をまとめたものです。情報は、有志により収集されており、その一部は論文や公開されているリソースなどから引用しています。

::: warning 以下の点について、あらかじめご理解とご了承をお願いいたします

  1. 本記事の内容は、完全性や正確性を保証するものではありません。これらの情報は予告なく変更されることがあり、また最新の情報を常に提供できるとは限りません。
  2. 一部の情報は、推測や個々の利用者の解釈にもとづくものである場合があります。そのため、全ての読者にとって必ずしも正確であるとは限りません。
  3. 本記事に記載されているモデルの多くは、MIT や Apache-2.0 といったオープンソースライセンスが適用されています。しかしながら、一部のモデルには、非営利限定のライセンス(例:CC BY-NC-SA 4.0)や開発元特有のライセンスが適応されており、これらは必ずしもオープンソースとは言えない可能性がある点にご注意ください。
  4. 個人が開発したモデルに関する記述では、作成者の敬称は省略させていただいております。 :::

この記事の管理は GitHub で行っています。記事の間違いを発見した場合、あるいはモデルの追加提案を行いたい場合は、GitHub Issues 経由で報告していただけますと幸いです。

::: details 目次 {open} [[toc]] :::

テキスト生成に主に使うモデル

画像を含むテキスト生成モデルはこちら

スクラッチ学習モデル

汎用

公開年 アーキテクチャ 入出力で扱える
トークン数
学習テキスト 開発元 ライセンス / 利用規約
Sarashina2-8x70B 2024 MoE
(8x70b (465b))
8,192 Sarashina2 (70B) に対して Sparse Upcycling で学習 SB Intuitions Sarashina Model NonCommercial License
LLM-jp-3 172B 2024 Llama
(172b, 172b-instruct2, 172b-instruct3)
4,096 事前学習: llm-jp-corpus-v3
(計 2.1T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k
DPO (instruct3 only): aya-ja-evol-inst, ac-self-inst
大規模言語モデル研究開発センター 事前学習済みモデル: LLM-jp-3 172B Terms of Use
事後学習済みモデル: llm-jp-3-172b-instruct3利用許諾契約
LLM-jp-3 172B beta2 2024 Llama
(172b-beta2, 172b-beta2-instruct2)
4,096 事前学習: llm-jp-corpus-v3の一部
(計 1.4T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k
大規模言語モデル研究開発センター LLM-jp-3 172B beta2 Terms of Use
LLM-jp-3 172B beta1 2024 Llama
(172b-beta1, 172b-beta1-instruct)
4,096 事前学習: llm-jp-corpus-v3の一部
(計 0.7T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2, Aya Dataset, ichikara-instruction-format, Daring-Anteater, FLAN
大規模言語モデル研究開発センター LLM-jp-3 172B beta1 Terms of Use
LLM-jp-3 172B alpha 2024 Llama
(172b-alpha1, 172b-alpha1-instruct, 172b-alpha2, 172b-alpha2-instruct)
4,096 事前学習: llm-jp-corpus-v3の一部
(alpha1: 計 0.7T トークン, alpha2: 計 1.4T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2, Aya Dataset, ichikara-instruction-format, Daring-Anteater, FLAN
大規模言語モデル研究開発センター Apache 2.0
Stockmark-2-100B-Instruct-beta 2025 Llama
(100B-Instruct-beta, 100B-Instruct-beta-AWQ)
4,096 事前学習: 計 1.5T トークン
Instruction Tuning
DPO
ストックマーク MIT
Stockmark-100b 2024 Llama
(100b, 100b-instruct-v0.1)
4,096 事前学習: RedPajama, 日本語 Wikipedia, Japanese mC4, Japanese CommonCrawl, 日本語特許, Stockmark Web Corpus
(計 910B トークン)
Instruction Tuning (LoRA): ichikara-instruction
ストックマーク MIT
PLaMo-100B-Pretrained 2024 Llama[^22]
(100b)
4,096 事前学習: Japanese CommonCrawl, RefinedWeb, 独自のデータセット
(計: 2.0T トークン)
Preferred Elements (Preferred Networks) PLaMo Non-Commercial License
LLM-jp-3.1 2025 Llama/MoE
(8x13b (73b), 8x13b (73b)-instruct4, 13b, 13b-instruct4, 1.8b, 1.8b-instruct4)
4,096 事前学習: llm-jp-corpus-v3
(計 2.5T トークン)
継続事前学習: インストラクション・レスポンスペア
(計 90B トークン)
SFT + DPO
大規模言語モデル研究開発センター Apache 2.0
LLM-jp-3 MoE 2025 MoE
(8x1.8b (9.3b), 8x1.8b (9.3b)-instruct2, 8x1.8b (9.3b)-instruct3, 8x13b (73b), 8x13b (73b)-instruct2, 8x13b (73b)-instruct3)
4,096 LLM-jp-3 (1.8b, 13b) に対して Drop-Upcycling で学習 大規模言語モデル研究開発センター Apache 2.0
Sarashina2 2024 Llama
(7b, 13b, 70b)
7b, 13b: 4,096
70b: 8,192
事前学習: Japanese Common Crawl, SlimPajama, StarCoder
(計 2.1T トークン)
SB Intuitions MIT
Sarashina1 2024 GPT-NeoX
(7b, 13b, 65b)
2,048 事前学習: Japanese Common Crawl
(計 1T トークン)
SB Intuitions MIT
Tanuki-8×8B 2024 MoE (47b)
(v1.0, v1.0-AWQ, v1.0-GPTQ-4bit, v1.0-GPTQ-8bit, v1.0-GGUF)
4,096 事前学習: 様々な Web 上のデータ, 合成データ(計 1.7T トークン)
SFT, DPO: 様々な合成データ [^19]
松尾研LLM開発プロジェクト Apache 2.0
LLM-jp-4 32B-A3B 2026 Qwen3 MoE
(32b-a3b-base, 32b-a3b-thinking, 32b-a3b-thinking-gguf)
65,536 事前学習 + 中間学習: llm-jp-corpus-v4.1, llm-jp-corpus-midtraining-v2
(計 11.7T トークン)
SFT: llm-jp-4-thinking-sft-data
DPO: llm-jp-4-32b-a3b-thinking-dpo-data
大規模言語モデル研究開発センター Apache 2.0
llm-jp-4-kappa 2026 Qwen3 MoE
(32b-a3b-v0.1)
65,536 LLM-jp-4 32B-A3B (thinking) に対して以下を実施
SFT: Nemotron-Cascade-2-SFT-Data, OpenMathReasoning, OpenCodeReasoning, Nemotron-SFT-Competitive-Programming-v2, llm-jp-4-thinking-sft-data など (計 443,747 件)
GRPO (数学): AceReason-Math から選別した 10,999 問
GRPO (コード): SYNTHETIC-2 から選別した約 3.1k 件
Third Intelligence Apache 2.0[^29]
PLaMo 3 2025 Gemma ベースのアーキテクチャ
(2b-base, 8b-base, 31b-base)
4,096 事前学習: 英語、日本語、コード、多言語
(2b: 200B トークン, 8b: 1T トークン, 31b: 3T トークン)
Preferred Networks PLaMo community license
Way-PLaMo-3-8b-chat 2025 PLaMo 3ベース (8b-chat) 4,096 Instruction Following SFT: Alpaca (51.7K), Dolly-15k-ja (15K) 個人 (WayBob) PLaMo community license
CyberAgentLM3 (CALM3) 2024 Llama
(22b-chat, 22b-chat-selfimprove-experimental)
16,384 不明
(計 2.0T トークン)
サイバーエージェント Apache 2.0
LLM-jp-3 13B instruct3 2025 Llama
(150m, 150m-instruct2, 150m-instruct3, 440m, 440m-instruct2, 440m-instruct3, 980m, 980m-instruct2, 980m-instruct3, 1.8b-instrcut2, 1.8b-instruct3, 3.7b-instruct2, 3.7b-instruct3, 7.2b-instruct2, 7.2b-instruct3, 13b-instruct2, 13b-instruct3)
4,096 事前学習: llm-jp-corpus-v3
(計 2.1T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, magpie-sft-v1.0, Daring-Anteater, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft-ja, Synthetic-JP-EN-Coding-Dataset-567k
DPO (instruct3 only): aya-ja-evol-inst, ac-self-inst
大規模言語モデル研究開発センター Apache 2.0
LLM-jp-3 13B 2024 Llama
(1.8b, 1.8b-instruct, 3.7b, 3.7b-instruct, 7.2b, 7.2b-instruct, 13b, 13b-instruct)
4,096 事前学習: llm-jp-corpus-v3
(計 2.1T トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, FLAN, ichikara-instruction-format, AutoMultiTurnByCalm3-22B, ramdom-to-fixed-multiturn-Calm3, wizardlm8x22b-logical-math-coding-sft_additional-ja, Synthetic-JP-EN-Coding-Dataset-567k
大規模言語モデル研究開発センター Apache 2.0
llm-jp-3-3.7b-instruct-EZO 2024 Llama
(3.7b-instruct-EZO-Common, 3.7b-instruct-EZO-Humanities)
4,096 LLM-jp-3 (3.7B) に対して追加学習 Axcxept Apache 2.0
LLM-jp-13B v2.0 2024 Llama
(13b-v2.0, 13b-instruct-full-dolly-ichikara_004_001_single-oasst-oasst2-v2.0, 13b-instruct-full-ac_001-dolly-ichikara_004_001_single-oasst-oasst2-v2.0, 13b-instruct-full-ac_001_16x-dolly-ichikara_004_001_single-oasst-oasst2-v2.0)
4,096 事前学習: llm-jp-corpus-v2
(計 260B トークン)
Instruction Tuning: ichikara-instruction, AnswerCarefully Dataset, Dolly Dataset, OASST1, OASST2
LLM-jp Apache 2.0
Fugaku-LLM 2024 GPT
(13B, 13B-instruct, 13B-instruct-gguf)
2,048 事前学習: 独自
Instruction Tuning: OASST1, Dolly Dataset, GSM8K
東工大, 東北大, 富士通, 理研, 名大, サイバーエージェント, Kotoba Technologies Fugaku-LLM Terms of Use
LLM-jp-13B v1.1 2024 GPT
(13b-instruct-lora-dolly_en-dolly_ja-ichikara_003_001-oasst_en-oasst_ja-v1.1, 13b-instruct-full-dolly_en-dolly_ja-ichikara_003_001-oasst_en-oasst_ja-v1.1, 13b-dpo-lora-hh_rlhf_ja-v1.1)
2,048 Instruction Tuning (LoRA or Full-parameter FT): Dolly Dataset, OASST1, ichikara-instruction
DPO (LoRA): HH RLHF
LLM-jp Apache 2.0
LLM-jp-13B 2023 GPT
(1.3b-v1.0, 13b-v1.0, 13b-instruct-full-jaster-v1.0, 13b-instruct-full-jaster-dolly-oasst-v1.0, 13b-instruct-full-dolly-oasst-v1.0, 13b-instruct-lora-jaster-v1.0, 13b-instruct-lora-jaster-dolly-oasst-v1.0, 13b-instruct-lora-dolly-oasst-v1.0)
2,048 事前学習: llm-jp-corpus (Wikipedia, Japanese mC4, The Pile, Stack) (計 300B トークン)
Instruction Tuning (Full-parameter FT or LoRA): jaster, Dolly Dataset, OASST1
LLM-jp Apache 2.0
PLaMo-13B 2023 Llama[^1]
(13b, 13b-instruct, 13b-instruct-nc)
base: 4,096
instruct, instruct-nc: 8,192
事前学習: C4, Project Gutenberg, RedPajama, 日本語 Wikipedia, Japanese mC4
(計 1.5T トークン)
Instruction Tuning: Dolly Dataset, HH RLHF, OASST1, llm-japanese-datasetのwikinews subset (NCモデルでは商用利用不可の Alpaca Dataset も含めて学習)
Preferred Networks Apache 2.0
(NC モデルは CC BY-NC 4.0)
Stockmark-13b 2023 Llama
(13b, 13b-instruct)
2,048 事前学習: 日本語 Wikipedia、Japanese CC-100、Japanese mC4、Japanese CommonCrawl、日本語特許、Stockmark Web Corpus
(計 220B トークン)
Instruction Tuning (LoRA): ichikara-instruction
ストックマーク baseモデル: MIT
instructモデル: CC BY-NC-SA 4.0
Weblab-10B 2023 GPT-NeoX
(10b, 10b-instruction-sft)
2,048 Japanese mC4 + The Pile(計 600B トークン)
*instruction-sft モデルは Alpaca Dataset, FLAN でファインチューニング
東大 松尾・岩澤研 CC BY-NC 4.0
LLM-jp-4 8B 2026 Llama
(8b-base, 8b-instruct, 8b-thinking, 8b-thinking-gguf)
65,536 事前学習 + 中間学習: llm-jp-corpus-v4.1, llm-jp-corpus-midtraining-v2
(計 11.7T トークン)
SFT: llm-jp-4-thinking-sft-data
DPO (thinking のみ): llm-jp-4-8b-thinking-dpo-data
大規模言語モデル研究開発センター Apache 2.0
PLaMo 2.1 8B 2025 Samba ベースのアーキテクチャ
(8b-cpt)
32,768 訓練詳細不明 Preferred Networks PLaMo community license
PLaMo 2 8B 2025 Samba ベースのアーキテクチャ
(8b)
日本語、英語等のデータ
(計 6T トークン)
Preferred Networks PLaMo community license
Tanuki-8B 2024 Tanuki (8b)
(v1.0, v1.0-AWQ, v1.0-GPTQ-4bit, v1.0-GPTQ-8bit, v1.0-GGUF)
4,096 事前学習: 様々な Web 上のデータ, 合成データ(計 1.3T トークン)
SFT, DPO: 様々な合成データ [^19]
松尾研LLM開発プロジェクト Apache 2.0
Japanese StableLM Alpha 2023 GPT-NeoX
(base-alpha-7b, instruct-alpha-7b, instruct-alpha-7b-v2)
2,048 Wikipedia, Japanese CC-100, Japanese mC4, Japanese OSCAR, RedPajama
(+ 独自のデータセット)[^2]
(計 750B トークン)
*instruct モデルでは Alpaca Dataset, Dolly Dataset, HH RLHF, llm-japanese-datasetのwikinews subsetでファインチューニング
(v2では商用利用不可の Alpaca Dataset を除外)
Stability AI baseモデル: Apache 2.0
instruct モデル (v1): 独自のライセンス
instruct モデル (v2): Apache 2.0
CyberAgentLM2 (CALM2) 2023 Llama
(7b, 7b-chat, 7b-chat-dpo-experimental)
base: 4,096
chat: 32,768
一般公開されている日本語・英語のデータセット(詳細不明) (計 1.3T トークン)
*dpo モデルは Chatbot Arena Conversations JA (calm2) Dataset を用いて DPO で学習
サイバーエージェント Apache 2.0
(dpo モデルのみ CC BY 4.0)
OpenCALM 2023 GPT-NeoX
(small, medium, large, 1b(1.4b), 3b(2.7b), 7b(6.8b))
2,048 日本語 Wikipedia
+ Jpanese mC4
+ Japanese CC-100
サイバーエージェント CC BY-SA 4.0
Stormy 2023 GPT-NeoX
(7b(6.8b))
2,048 OpenCALM (6.8b) に対して
llm-japanese-dataset v0 のうち翻訳タスクを除いたデータで LoRAチューニング
東大 和泉研 CC BY-SA 4.0
ByGPT-JP 2025 Llama ベース
(multi-lm-head-6.5b-alpha)
5,760 llm-jp-corpus-v3 のサブセット (ja_cc, ja_warp_html, ja_warp_pdf, ja_wiki, kaken) 東北大
自然言語処理研究グループ
Apache 2.0
rinna GPT
(英語やコードも含めて学習されたモデル)
2023 GPT-NeoX
(4b(3.8b), 4b(3.8b)-8k, 4b(3.8b)-instruction-sft, 4b(3.8b)-instruction-ppo)
8kモデル: 8,192
他: 2,048
Wikipedia, Japanese CC-100, Japanese C4, RedPajama, The Pile
(計 524B トークン)
*8k モデルでは 4,000トークンを超える長いトークン列でファインチューニング
*instruction-sft モデルでは HH RLHF、FLAN でファインチューニング
*instruction-ppo モデルでは HH RLHF で PPO ベースの強化学習
rinna MIT
japanese-large-lm 2023 GPT-NeoX
(1.7b, 3.6b, 1.7b-instruction-sft, 3.6b-instruction-sft)
2,048 日本語 Wikipedia, Japanese CC-100, Japanese C4, Japanese OSCAR や独自データなど
(計 650GB)
*instruction-sft モデルでは OASST1 でファインチューニング
LINE Apache 2.0
rinna GPT
(日本語のみで学習されたモデル)
2023 GPT または GPT-NeoX
(xsmall, small, medium, 1b, neox-small, neox-3.6b-instruction-sft-v2, neox-3.6b-instruction-ppo)
≤ 2,048 日本語 Wikipedia
+ Japanese CC-100
(1b 以降のモデルでは
さらに Japanese mC4 を追加)
*instruction-sft, sft-v2 モデルでは HH RLHF、FLAN、SHP データセットでさらにファインチューニング
*instruction-ppo モデルでは HH RLHF でさらに PPO ベースの強化学習
rinna MIT
Sarashina2.2 2025 Llama
(0.5b, 0.5b-instruct-v0.1, 1b, 1b-instruct-v0.1, 3b, 3b-instruct-v0.1)
8,192 SB Intuitions MIT
レトリバT5 2023 T5
(small (short), small (medium), small (long), base (short), base (medium), base (long), large (short), large (medium), large (long), xl(3b))
日本語 Wikipedia + Japanese mC4 レトリバ CC BY-SA 4.0
Spiral-RetNet-3b-base 2024 RetNet
(3b)
2,048 Wikipedia, Japanese CC-100, CulturaX Spiral.AI MIT
kotomamba-2.8B 2024 Mamba
(2.8B-v1.0)
2,048 日本語 Wikipedia, Swallow Corpus, SlimPajama Kotoba Technologies Apache 2.0
ABEJA GPT 2022 GPT または GPT-NeoX
(large, neox-2.7b)
日本語 Wikipedia
+ Japanese CC-100
+ Japanese OSCAR
ABEJA MIT
PLaMo 2.1 2B 2025 Causal decoder-only transformer
(2b-cpt)
32,768 訓練詳細不明 Preferred Networks PLaMo community license
Rakuten AI 2.0 mini 2025 Mistral
(mini(1.5b), mini(1.5b)-instruct)
131,072 楽天 Apache 2.0
早大GPT 2022 GPT
(small, xl(1.5b))
日本語 Wikipedia
+ Japanese CC-100
早大 河原研 CC BY-SA 4.0
ストックマークGPT 2023 GPT-NeoX
(1.4b)
日本語 Wikipedia (0.88B トークン)
+ Japanese CC-100 (10.5B トークン)
+ 独自のWebデータ (8.6B トークン)
ストックマーク MIT
イエローバックGPT 2021 GPT-NeoX
(1.3b)
日本語 Wikipedia
+ Japanese CC-100
+ Japanese OSCAR
イエローバック Apache 2.0
PLaMo 2 1B 2025 Samba ベースのアーキテクチャ
(1b)
日本語、英語等のデータ
(計 4T トークン)
Preferred Elements (Preferred Networks) Apache 2.0
Sarashina2.1-1B 2024 Llama
(1b)
8,192 Web 上などの日本語・英語データ(計 10T トークン) SB Intuitions Sarashina Model NonCommercial License
colorfulscoop GPT 2021 GPT
(small)
日本語 Wikipedia Colorful Scoop CC BY-SA 3.0
東工大GPT 2023 GPT
(medium, medium (逆方向)) [^3]
日本語 Wikipedia + Japanese CC-100 東工大 岡崎研 CC BY-SA 4.0
京大GPT 2022 GPT
(small (文字レベル), medium (文字レベル), large (文字レベル))
日本語 Wikipedia (約2,700万文 (3.2GB))
+ Japanese CC-100 (約6億1,900万文 (85GB))
+ Japanese OSCAR (約3億2,600万文 (54GB))
京大 言語メディア研究室 CC BY-SA 4.0
日本語BART 2023 BART
(base, large)
日本語 Wikipedia (約1,800万文) 京大 言語メディア研究室 CC BY-SA 4.0
Megagon Labs T5 2021 T5
(base)
Japanese mC4 (87,425,304 ページ (782 GB))
+ Japanese wiki40b (828,236 記事 (2 GB))
Megagon Labs
(リクルート)
Apache 2.0

ドメイン特化型

公開年 ドメイン アーキテクチャ 学習テキスト 開発元 ライセンス
SIP-med-LLM/SIP-jmed-llm-3-8x13b-OP-32k-R0.1 2026 医療 MoE 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 Instruction Tuning 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ Apache 2.0[^25]
SIP-med-LLM/SIP-jmed-llm-3-8x13b-AC-32k-instruct 2025 医療 MoE 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 PMC-Patients 等を用いた Instruction Tuning 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ SIP-jmed-llm-3-8x13b-AC-32k-instruct Terms of Use[^25]
SIP-med-LLM/SIP-jmed-llm-3-8x13b-OP-4k-base 2025 医療 MoE 医療系コーパス (78.3B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ Apache 2.0[^25]
SIP-med-LLM/SIP-jmed-llm-2-8x13b-OP-instruct 2025 医療 MoE 医療系コーパス (44.2B トークン) で LLM-jp-3 MoE (8x13b) に追加事前学習、その後 Instruction Tuning 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ Apache 2.0[^25]
SIP-med-LLM/SIP-jmed-llm-3-13b-OP-32k-R0.1 2026 医療 Llama 医療系コーパス (78.3B トークン) で LLM-jp-3.1 (13b) に追加事前学習、コンテキスト長を 32k に拡張、その後 Instruction Tuning 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ Apache 2.0[^25]
SIP-med-LLM/SIP-jmed-llm-3-13b-OP-4k-base 2025 医療 Llama 医療系コーパス (78.3B トークン) で LLM-jp-3.1 (13b) に追加事前学習 戦略的イノベーション創造プログラム(SIP)第3期課題「統合型ヘルスケアシステムの構築における生成 AI 活用」テーマ1「安全性・信頼性を持つオープンな医療 LLM の開発・社会実装」 研究グループ Apache 2.0[^25]
AscleLM-1-10B 2026 医療 Mamba-2 Hybrid
(Nemotron-H ベース)
事前学習: Nemotron-CC v1 (約 6.3T トークン)、オープンソースの日本語・英語・中国語コーパス、コード・数学・推論データ (計 約 8.5T トークン)、および医学論文・医学書籍・診療ガイドライン・試験問題を由来とする合成データ 東大 松尾・岩澤研 AscleLM-1-10B Terms of Use[^27]
日本語対話Transformer 2021 対話 Transformer Twitter 上の日本語リプライのペア NTT 独自のライセンス
日本語ニュースBART 2023 ビジネス BART (base) 日本語ビジネスニュース記事(約2,100万記事 (2.9億文)) ストックマーク MIT
AcademicBART 2023 学術 BART (base) CiNii の日本語論文 愛媛大 人工知能研究室 Apache 2.0

海外モデルに日本語で継続事前学習を行ったモデル

※継続事前学習後に事後学習(SFT, DPO, RLなど)を行ったモデルも含みます

汎用

公開年 ベースのLLM 学習テキスト 開発元 ライセンス / 利用規約
GPT-OSS Swallow 120B
(120B-SFT-v0.1, 120B-RL-v0.1, 120B-RL-v0.1-MXFP4)
2026 GPT-OSS (120b) 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2
(計 419.4B トークン)
SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1
RL: allenai/Dolci-Think-RL-7B (Math subset)
Swallowプロジェクト Apache 2.0
Llama 3.3 Swallow 70B
(70B-v0.4, 70B-Instruct-v0.4)
2025 Llama 3.3 (70b) 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3
Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1, Swallow-Code-v0.3-Instruct-style
Swallowプロジェクト Llama 3.3 Community License & Gemma Terms of Use
Llama 3.1 Swallow 70B
(70B-v0.1, 70B-Instruct-v0.1, 70B-Instruct-v0.3)
2024 Llama 3.1 (70b) 事前学習: The Stack v2, Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus
Instruction Tuning: lmsys-chat-1m-synth-ja-wo-pii-and-template-instructions, lmsys-chat-1m-synth-en-wo-pii-and-template-instructions, filtered-magpie-ultra-ja, filtered-magpie-ultra-en, gemma-magpie
Swallowプロジェクト Llama 3.1 Community License
(Instructモデルは Gemma Terms of Use も適用)
cyberagent/Llama-3.1-70B-Japanese-Instruct-2407 2024 Llama 3.1 (70b) 不明 サイバーエージェント Llama 3.1 Community License
Llama 3 Swallow 70B
(70B-v0.1, 70B-Instruct-v0.1)
2024 Llama 3 (70b) 事前学習: Algebraic Stack, Wikipedia, RefinedWeb, Swallow Corpus, Cosmopedia, Laboro ParaCorpus, OpenWebMath
Instruction Tuning: OASST1 [^17]
Swallowプロジェクト Llama 3 Community License
turing-motors/Llama-3-heron-brain-70B-v0.3 2024 Llama 3 (70b) Llama 3 Swallow 70B に対して追加学習(詳細不明) Turing Llama 3 Community License
Llama 3 Youko 70B
(70b, 70b-instruct, 70b-gptq, 70b-instruct-gptq)
2024 Llama 3 (70b) 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
(計 5B トークン)
Instruction Tuning: 独自のデータセット[^11]
rinna Llama 3 Community License
Swallow 70B
(70b-hf, 70b-instruct-hf, 70b-instruct-v0.1, 70b-NVE-hf, 70b-NVE-instruct-hf)
2023 Llama 2 (70b) 事前学習: 日本語 Wikipedia, RefinedWeb, Swallow Corpus, The Pile
Instruction Tuning: Dolly Dataset, HH RLHF, OASST1
*v0.1モデルでは OASST1, OASST2 を使用
Swallowプロジェクト Llama 2 Community License
KARAKURI LM
(70b-v0.1, 70b-chat-v0.1)
2024 Llama 2 (70b) 事前学習: mC4, CC100, OSCAR, RedPajama, 独自のデータセット
(計 16B トークン)
SteerLM: OASST2, 独自のデータセット
カラクリ Llama 2 Community License[^13]
Japanese Stable LM Beta 70B
(base-beta-70b, instruct-beta-70b)
2023 Llama 2 (70b) 事前学習: Wikipedia, Japanese mC4, Japanese CC-100, Japanese OSCAR, SlimPajama(Books3を除外)
(計 100B トークン)
Instruction Tuning: Dolly Dataset, HH RLHF, OASST1
Stability AI Llama 2 Community License
Fujitsu-LLM-KG
(8x7B_cpt, 8x7B_inst-infer_v1, 8x7B_inst-infer_v2, 8x7B_inst-gen_ja, 8x7B_inst-gen_en)
2025 Mixtral-8x7B-Instruct-v0.1 (46.7b) 事前学習: 知識グラフ並列コーパス(森羅プロジェクト、Wikipedia等から合成) 2.1Bトークンを含む計約300Bトークン
Instruction Tuning: 知識グラフ推論・生成タスク用データセット
富士通 Apache 2.0
Swallow-MX 8x7B
(8x7b-NVE-v0.1)
2024 Mixtral-8x7B-Instruct-v0.1 (46.7b) 事前学習: Algebraic Stack, Japanese Wikipedia, RefinedWeb, Swallow Corpus, The Pile, The Vault Swallowプロジェクト Apache 2.0
KARAKURI LM 8x7B Instruct v0.1
(8x7b-instruct-v0.1)
2024 Mixtral-8x7B-Instruct-v0.1 (46.7b) Swallow-MX 8x7B に対して以下のデータセットで学習: Dolly Dataset, OASST2, HelpSteer, glaive-code-assistant-v3, glaive-function-calling-v2, synthetic_text_to_sql, MetaMathQA, orca-math-word-problems-200k, rag-dataset-12000, rag-hallucination-dataset-1000, 独自のデータセット カラクリ Apache 2.0 (?)[^12]
KARAKURI LM 8x7B Chat v0.1
(8x7b-chat-v0.1)
2024 Mixtral-8x7B-Instruct-v0.1 (46.7b) Swallow-MX 8x7B に対して
SteerLM: OASST2, HelpSteer, 独自のデータセット
カラクリ Apache 2.0
ABEJA-Mixtral-8x7B-japanese
(8x7B-v0.1-japanese, 8x7B-Instruct-v0.1-japanese, 8x7B-Instruct-v0.1-japanese-alpha, 8x7B-Instruct-v0.1-japanese-alpha-merged)
2024 Mixtral-8x7B-Instruct-v0.1 (46.7b)
*Instructが名前に付いていないモデルのみ Mixtral-8x7B-v0.1 がベース
事前学習: Japanese CC, Redpajama, 独自
(計 450B トークン)
ABEJA Apache 2.0
Qwen3 Swallow 32B
(32B-CPT-v0.2, 32B-SFT-v0.2, 32B-RL-v0.2, 32B-RL-v0.2-AWQ-INT4)
2026 Qwen3 (32b) 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2
(計 209.7B トークン)
SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1
RL: allenai/Dolci-Think-RL-7B (Math subset)
Swallowプロジェクト Apache 2.0
ELYZA-Thinking-1.0-Qwen-32B
(32B)
2025 Qwen 2.5 (32b) 事前学習 + SFT (Reasoning) ELYZA Apache 2.0
ELYZA-Shortcut-1.0-Qwen-32B
(32B)
2025 Qwen 2.5 (32b) 事前学習 + SFT ELYZA Apache 2.0
ABEJA-Qwen2.5-32b-Japanese-v1.0
(v1.0)
2025 Qwen2.5-32B-Instruct (32b) 継続事前学習 + SFT + DPO: 約2万件の合成データ・人手アノテーションデータセット(抽出・推論能力に特化) ABEJA Apache 2.0
Qwen2.5 Bakeneko 32B
(qwen2.5-bakeneko-32b, qwen2.5-bakeneko-32b-instruct, deepseek-r1-distill-qwen2.5-bakeneko-32b, qwq-bakeneko-32b)
2025 Qwen 2.5 (32b) rinna Apache 2.0
ABEJA-QwQ32b-Reasoning-Japanese-v1.0
(v1.0)
2025 Qwen 2.5 (32b) ABEJA-Qwen2.5-32b-Japanese-v0.1 に QwQ 32b の Chat Vector をマージした上で追加学習 ABEJA Apache 2.0
ABEJA-Qwen2.5-32b-Japanese-v0.1
(32b-Japanese-v0.1)
2025 Qwen 2.5 (32b) 事前学習: Common Crawl, Cosmopedia, 独自
(計 100B トークン)
+ Chat Vector
ABEJA Apache 2.0
neoAI-JP-QwQ-32B
(32B)
2025 Qwen 2.5 (32b) 継続事前学習: llm-jp-corpus v3から約4Bトークン
+ QwQ-32BのChat Vector
neoAI Apache 2.0
neoAI-JP-DeepSeek-Qwen-32B
(32B)
2025 Qwen 2.5 (32b) 継続事前学習: llm-jp-corpus v3から約4Bトークン
+ DeepSeek-R1-Distill-Qwen-32BのChat Vector
neoAI Apache 2.0
Qwen3 Swallow 30B-A3B
(30B-A3B-CPT-v0.2, 30B-A3B-SFT-v0.2, 30B-A3B-RL-v0.2, 30B-A3B-RL-v0.2-AWQ-INT4)
2026 Qwen3 (30b-A3B) 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2
(計 209.7B トークン)
SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1
RL: allenai/Dolci-Think-RL-7B (Math subset)
Swallowプロジェクト Apache 2.0
Gemma-2-Llama Swallow 27B
(27b-pt-v0.1, 27b-it-v0.1)
2025 Gemma 2 (27b) 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3
Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1
Swallowプロジェクト Llama 3.3 Community License & Gemma Terms of Use
GPT-OSS Swallow 20B
(20B-SFT-v0.1, 20B-RL-v0.1, 20B-RL-v0.1-MXFP4)
2026 GPT-OSS (20b) 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2
(計 419.4B トークン)
SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1
RL: allenai/Dolci-Think-RL-7B (Math subset)
Swallowプロジェクト Apache 2.0
ABEJA-Qwen3-14B-Agentic-256k-v0.1
(v0.1)
2026 Qwen3 (14b) 継続事前学習: 長文合成データ(YaRN によりコンテキスト長を128k→256kに拡張)
+ Agentic 能力強化のための強化学習
ABEJA Apache 2.0
Nekomata 14B
(14b, 14b-instruction, 14b-gguf, 14b-instruction-gguf)
2023 Qwen (14b) 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
(計 66B トークン)
Instruction Tuning: Dolly Dataset, FLAN, llm-japanese-datasetの一部
rinna Tongyi Qianwen LICENSE
Swallow 13B
(13b-hf, 13b-instruct-hf, 13b-instruct-v0.1, 13b-NVE-hf)
2023 Llama 2 (13b) 事前学習: 日本語 Wikipedia, RefinedWeb, Swallow Corpus, The Pile
Instruction Tuning: Dolly Dataset, HH RLHF, OASST1
*v0.1モデルでは OASST1, OASST2 を使用
Swallowプロジェクト Llama 2 Community License
LEIA-Swallow-13B
(13b)
2024 Llama 2 (13b) Swallow 13B に対して LEIA で追加学習 個人 (山田育矢, 李凌寒) Llama 2 Community License
ELYZA-japanese-Llama-2-13b
(13b, 13b-instruct, 13b-fast, 13b-fast-instruct)
2023 Llama 2 (13b) 事前学翕: 日本語 Wikipedia, Japanese OSCAR, その他クロールデータなど
(計 18B トークン)
Instruction Tuning: 独自のデータセット
ELYZA Llama 2 Community License
cyberagent/Mistral-Nemo-Japanese-Instruct-2408 2024 Mistral NeMo (12b) 不明 サイバーエージェント Apache 2.0
NVIDIA-Nemotron-Nano-9B-v2-Japanese
(9B)
2026 Nemotron-Nano (9b) 継続事前学習: Wikipedia, fineweb-2 Japanese, aozorabunko, sip3-ja-general-web-corpus, Nemotron-CC-v2.1, Nemotron-Pretraining-Specialized-v1
SFT: Nemotron-Personas-Japan をシードセットとした Tool Calling データセット, Nemotron-Post-Training-v3
NVIDIA NVIDIA Nemotron Open Model License Agreement
Gemma-2-Llama Swallow 9B
(9b-pt-v0.1, 9b-it-v0.1)
2025 Gemma 2 (9b) 事前学習: Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus, FineMath-4+, Swallow Code Version 0.3
Instruction Tuning: Gemma-2-LMSYS-Chat-1M-Synth, Swallow-Magpie-Ultra-v0.1, Swallow-Gemma-Magpie-v0.1
Swallowプロジェクト Llama 3.3 Community License & Gemma Terms of Use
Qwen3 Swallow 8B
(8B-CPT-v0.2, 8B-SFT-v0.2, 8B-RL-v0.2, 8B-RL-v0.2-AWQ-INT4)
2026 Qwen3 (8b) 事前学習: Wikipedia, Swallow Corpus v3.2, Nemotron-CC, Cosmopedia, Laboro ParaCorpus, Swallow Math v2, Swallow Code v2
(計 209.7B トークン)
SFT: GPT-OSS-LMSYS-Chat-1M-Synth, Swallow-Nemotron-Post-Training-Dataset-v1
RL: allenai/Dolci-Think-RL-7B (Math subset)
Swallowプロジェクト Apache 2.0
Llama 3.1 Swallow 8B
(8B-v0.1, 8B-Instruct-v0.1, 8B-v0.2, 8B-Instruct-v0.2, 8B-Instruct-v0.3, 8B-Instruct-v0.5)
2025 Llama 3.1 (8b) 事前学習: The Stack v2, Wikipedia, DCLM-baseline-1.0, Swallow Corpus Version 2, Cosmopedia, Laboro ParaCorpus
Instruction Tuning: lmsys-chat-1m-synth-ja-wo-pii-and-template-instructions, lmsys-chat-1m-synth-en-wo-pii-and-template-instructions, filtered-magpie-ultra-ja, filtered-magpie-ultra-en, gemma-magpie, Gemma-3-LMSYS-Chat-1M-Synth
Swallowプロジェクト Llama 3.1 Community License
(Instructモデルは Gemma Terms of Use も適用)
Llama 3 Swallow 8B
(8B-v0.1, 8B-Instruct-v0.1)
2023 Llama 3 (8b) 事前学習: Algebraic Stack, Wikipedia, RefinedWeb, Swallow Corpus, Cosmopedia, Laboro ParaCorpus, OpenWebMath
Instruction Tuning: OASST1 [^17]
Swallowプロジェクト Llama 3 Community License
turing-motors/Llama-3-heron-brain-8B-v0.3 2024 Llama 3 (8b) Llama 3 Swallow 8B に対して追加学習(詳細不明) Turing Llama 3 Community License
Llama 3 Youko 8B
(8b, 8b-instruct, 8b-gptq, 8b-instruct-gptq)
2024 Llama 3 (8b) 事前学習: Wikipedia, Japanese C4, Japanese CC-100, Japanese OSCAR, The Pile, 独自のデータセット
(計 22B トークン)
Instruction Tuning[^11]: Aya Dataset (Japanese subset), FLAN, Dolly Dataset, HH RLHF, OASST1, OASST2, MetaMathQA, CodeAlpaca Dataset, 独自のデータセット
DPO: HelpSteer, HelpSteer2, 独自のデータセット
rinna Llama 3 Community License
Llama 3 ELYZA JP 8B
(8B, 8B-GGUF, 8B-AWQ)
2024 Llama 3 (8b) 不明 ELYZA Llama 3 Community License
Llama 3 neoAI 8B Chat v0.1
(8B-Chat-v0.1)
2024 Llama 3 (8b) 不明 neoAI Llama 3 Community License
Llama 3 tedllm
(v0)
2024 Llama 3 (8b) 事前学習: 日本語の一般コーパス 東京エレクトロン デバイス Llama 3 Community License
ELYZA-Shortcut-1.0-Qwen-7B
(7B)
2025 Qwen 2.5 (7b) 事前学習 + SFT ELYZA Apache 2.0
ELYZA-Diffusion-1.0-Dream-7B
(Base-7B, Instruct-7B)
2026 Dream (7b) 事前学習: 日本語テキスト (約 62B トークン)
Instruction Tuning: 日本語の指示データ (約 0.18B トークン)
ELYZA Apache 2.0

This HTML preview is truncated for page performance. The canonical Markdown file contains the complete snapshot.

MARKDOWN METRICS
11170words
55headings
1184links
1code blocks
MDRSS ASSESSMENT
Evidence46/100medium confidence
Why MDRSS assigned this score
  • Production catalog audit 2026-08-04
  • Taxonomy classified from title, annotation, source and Markdown signals
  • Agent usefulness evaluated from structure, procedures, examples, evidence and retrieval value
Evidence (1)

Discussion 0

Sign in to join the discussion.