「生成AIの利用は権利侵害への加担」と
いう主張を分解して考える

  • 「許諾を取っていない」ことと「違法である」ことは別です。日本の著作権法には、情報解析のための利用を一定の範囲で認める規定があります。
  • 機械学習の「学習」は、作品をファイルとして抱え込む処理ではありません。ただし、更新されたパラメータから元データに近いものを取り出せる場合はあります。
  • 著作権は生まれつき持っている権利ではなく、表現には独占を認めつつ、アイデアや技法は独占させないという線を後から引いた制度です。
  • 「使う人は加害者だ」まで主張を進めると、その原則を検索や翻訳、人間の模倣にも同じように当てはめられるかを説明する必要が出てきます。

SNSで、生成AIは他人の知財を無断利用したデータセットで成り立つ商売であり、漫画村のようなものだ、使っている人はその権利侵害に加担している、という趣旨の文章を読みました。

言いたいことはわかります。 ただ、この理屈をそのまま検索エンジンに当てはめたらどうなるだろう、と思いました。 検索エンジンも、他人のウェブページを許諾なくクロールし、複製し、解析して索引を作っています。

同じ原則を通すなら、検索も機械翻訳も迷惑メール判定も推薦システムも、まとめて糾弾の対象になってしまう。 そうならないのは、元の主張が本当は複数の別々の問題を、一本の矢印でつないでいるからだと思います。

関連記事

1. 「無断で使っている」と「違法に使っている」は別のこと

1.1. 「許諾がない」だけでは違法性は決まらない

日本の著作権法には30条の4という条文があります。 著作物に表現された思想や感情を人が味わうこと、法律の言葉でいう「享受」を目的としない利用については、必要と認められる範囲で許諾なく使ってよい、という規定です1。 情報解析はその代表例として条文に挙げられています。

ここで混ざりやすいのが「営利目的」と「享受目的」です。 AI企業が学習によって利益を上げているのは、たしかに営利目的。 でも営利であることと、作品を味わわせることを目的にしていることは、法律上の別々の話です2

だから「商売にしている、だから享受目的だ、だから違法だ」という連鎖には飛躍があります。 一方で、30条の4には著作権者の利益を不当に害する場合を除くという但し書きがあり、特定の作家の作品だけを集めて作風の再現に特化したモデルを作るような場合には、評価が変わる余地があります3。 生成AIについての裁判例の蓄積がまだ乏しいことは、文化庁自身が認めているところです4

1.2. 漫画村は原作品そのものを読ませる仕組み

漫画村にたとえる気持ちも、半分はわかります。 ただ、漫画村型のサービスは、著作物そのものを利用者に読ませ、正規の作品と直接入れ替わる仕組みでした。 生成AIの学習は、入力された作品を解析してモデルの数値に反映する過程で、作品そのものをそのまま閲覧させるわけではありません。

この区別は、Anthropicをめぐる米国の訴訟にもはっきり出ています。 裁判所は、合法に入手した書籍をAIの学習に使うことと、海賊版サイトから書籍を集めて恒久的な蔵書を作ることを分けて扱いました5。 争点は「学習という行為そのもの」から「学習データをどう入手したか」へ移りつつあります6

そして、無断の大量解析それ自体を悪とする原則を採ると、冒頭の検索エンジンの話に戻ってきます。 検索と生成AIが同じだと言いたいわけではありません。 検索は基本的に元のサイトへ人を送りますが、生成AIは元の作品を見なくても代わりになるものを作れてしまう。 この代替性こそが、生成AIに固有の論点です。

2. 学習とコピーの間には、昔からある境界線がある

2.1. 辞書の意味とオープンソースのコードで考える

「猫は哺乳類の一種である」という意味そのものを、誰かが独占することはできません。 けれど、ある辞書独自の説明文をそのまま大量に転載すれば、話は変わります。 著作権が守るのは、思想や感情を創作的に表現したものであって、事実やアイデアそのものではないからです7

オープンソースのコードでも同じことが起きます。 著作権法は、プログラム言語、規約、解法には保護が及ばないと明記しています8。 GPLのコードを読んで「なるほど、このアルゴリズムで解いているのか」と理解し、そのアイデアだけを使って自分で書き直したなら、元のライセンスが当然に伝わってくるわけではありません。

ただ、変数名を変えて関数を分割しただけで、元のコード固有の構造をそのまま引き継いでいるなら、打ち直したという事実だけでは問題は消えません。 著作権には翻案権、つまり既存作品の本質的な特徴を保ったまま別の形に作り替える行為についての権利もあります9。 完全なコピーから、改変コピー、強い模倣、影響を受けた創作、共通のアイデアを独立に表現したものまで、実際には連続しています。

2.2. 画像でも、機械がやっているのはパラメータの調整

機械学習でいう「学習」は、日常語の学習とは指しているものが違います。 モデルには数十億個のパラメータ、つまり内部の重みと呼ばれる数値があり、訓練とは、予測の誤差を測る損失関数の値が小さくなる方向へ、その数値を少しずつ動かしていく計算です。 画像生成でよく使われる拡散モデルなら、ノイズを載せた画像から元の方向を予測する関数を、言語モデルなら、次に来る語の確率分布を、それぞれ調整していきます10

どちらも、個々の事例を保管するための処理ではなく、大量の事例に共通する統計的な規則性をパラメータへ写す処理です。 遠近法、顔の造形、水彩の質感、アニメ絵の輪郭線の傾向。 そういったものが抽出される点で、文章から文法や語の共起関係を取り出すこととそう変わりません。

では、なぜ画像のほうが強く問題視されるのか。 目の描き方、線、配色、陰影、構図が積み重なると、見る側には「明らかにこの作家の絵だ」と感じられます。 ところが法律上は、作風が共通しているだけなら原則として侵害ではなく、特定作品の創作的な表現を直接感じ取れる水準に達してはじめて侵害になり得る11。 人が感じ取る作者性と、著作権が守っている具体的表現が、画像では大きくずれるわけです。

2.3. モデルの中に作品があるのか、という問い

学習前には、画像A.jpgや文章C.txtという具体的なファイルがあります。 学習後のモデルにあるのは、それらを使って更新された数値の集まりで、ファイルとして格納されているわけではありません。 文化庁の整理も、生成AIは学習データを切り貼りして出力するものではない、という技術的前提を置いています12

ただ、ファイルとして保存されていないことと、元データを復元できないことは同じではありません。 大規模言語モデルから学習時の文章を逐語的に取り出せる場合があることは研究で示されていますし13、拡散モデルでも訓練画像にきわめて近い画像を再生成できた実験があります14。 学習データに重複して大量に含まれていた画像ほど、そうなりやすい傾向があります。

なので、モデルが作品を「含む」という言葉は三段階に分けたほうがいい。 そのデータによって重みがわずかに変わった状態、特定の事例の情報が強く残った記憶(memorization:メモライゼーション)の状態、そして入力次第で元データに近いものを取り出せる再抽出(training data extraction:訓練データ抽出)の状態。 「学習した、つまり盗んで保存した」も「重みになった、つまり何も残っていない」も、どちらも粗い言い方です。

3. 著作権は自然権ではなく、線を引くために作られた制度

3.1. アン法と droit d’auteur という二つの源流

著作権を、生まれながらに持っている絶対的な所有権のようなものだと考えると、ここまでのグレーゾーンが理解しにくくなります。 近代以前のイギリスでは、印刷は王権による特権や出版業者の統制と結びついていました。 1710年のアン法(Statute of Anne:アン女王法)は、学問の奨励を掲げて、作者に一定期間の排他的な印刷権を与えた法律です15

期間限定だったことが大事なところで、アメリカ合衆国憲法も、著作者に「limited Times」の排他的権利を与えることで学術と有用な技芸の進歩を促す、と書いています16。 権利そのものが目的ではなく、文化や技術を前へ進める手段として組み立てられている。 一方、フランス語の droit d’auteur(ドロワ・ドートゥール:作者の権利)は、作品を作者の人格の表れとみる発想が強く、この流れから著作者人格権が育ちました17

日本の制度には両方が同居しています。 著作権法の目的規定は、著作者の権利を最大限守るとは書いておらず、公正な利用に留意しつつ権利の保護を図り、文化の発展に寄与する、としています18。 世界人権宣言27条2項は作者の精神的・物質的利益の保護を人権として認めていますが、同じ条の1項は文化生活に参加し科学の進歩の恩恵にあずかる権利も並べて置いています19

3.2. 18世紀は1対1、いまは多対1

初期の著作権が相手にしていた問題は、かなりわかりやすい形をしていました。 Aが本を書き、Bが勝手に同じ本を印刷し、Bの本がAの本の売上を奪う。 原作品と侵害物が1対1で対応していて、copy-right、つまりコピーの権利という言葉がよく効く世界です。

写真、録音、映画、放送、ソフトウェア、インターネットと技術が増えるにつれ、複製だけでは足りなくなりました。 いまの著作権は、複製権のほかに翻案権や公衆送信権など、多くの権利の束になっています。

生成AIは、その延長にありながら形が違います。 数十億の作品を解析してパラメータに反映し、そこから新しい出力が出てくる。 誰の何をコピーしたのかという18世紀型の問いだけでは、うまく捉えられません。

4. 「使う人が加害者だ」まで進むには、別の論証が要る

4.1. 個人倫理と社会規範のあいだにある段差

法的にも倫理的にも未整理な部分が残っている以上、疑義があるので自分は使わない、という選択には十分な理由があります。 不確実なリスクがあるときに慎重な側を選ぶ、予防原則に近い態度です。 そこまでは、他人が口を挟むところではありません。

問題は、そこから先に段差があることです。 自分が避ける、他人に勧める、他人を非倫理的だと非難する、他人の利用を禁止する。 後ろへ行くほど、なぜその行為が第三者に無視できない害を与えるのかを示す負担が重くなります。

企業に利益を与えることが加担にあたる、という言い方にも同じ段差があります。 他者の不正に何らかの形で関与することを moral complicity(モラル・コンプリシティ:道徳的加担)と呼びますが、これを強く採ると、複雑なサプライチェーンや環境負荷を抱えた日常の買い物のほとんどが引っかかってしまう。 お酒についても、社会は全面排除ではなく、年齢制限や飲酒運転規制のように害の大きい部分を切り分けて規制しています。

4.2. 断定した方が広まるという構造

ここにアテンションエコノミー(attention economy:注意の経済)が重なります。 人の注意そのものが希少な資源として奪い合われる仕組みのもとでは、慎重な主張より、怒りや道徳的非難を含んだ投稿のほうが広がりやすい。 道徳的・感情的な表現を含む政治的投稿ほど共有されやすいことは、複数のデータで確認されています20

「生成AIには著作権上の未解決の論点が複数あり、用途ごとに評価が要る」より、「AIは盗作機械だ」のほうが一瞬で伝わります。 慎重な人はわざわざ投稿しないので、タイムラインには両極だけが並ぶ。 これは反対派だけの問題ではなく、「反AIは技術を理解していない」という単純化も同じ構造です21

そして、強い断定にはもう一つ引っかかることがあります。 「本人の許諾なく著作物から特徴を学ぶこと自体が不当だ」という原則を立てると、その射程は人間の模倣学習や、辞書、翻訳、ソフトウェア開発にも届きかねません。 逆に「具体的な複製でなければ何をしてもよい」とすれば、実質的な盗作まで通してしまう。 自分が採る原則を生成AI以外にも一貫して当てはめられるか、という点は、糾弾の調子が強くなるほど確かめておいたほうがよさそうです。

生成AIに問題があると指摘すること自体は、まったく正当だと思います。 難しいのは、その問題を狭く正確に定義するほうで、たぶんこちらのほうが手間がかかる。 境界がまだ争われているうちは、「ここは問題だ、ここはまだ判断できない」と分けて言うことが、いちばん誠実で、いちばん広まりにくい言い方なのだろうと思います。

  1. 条文は「自ら享受し又は他人に享受させることを目的としない場合には、その必要と認められる限度において、いずれの方法によるかを問わず、利用することができる」と定め、情報解析を「多数の著作物その他の大量の情報から、当該情報を構成する要素に係る情報を抽出し、比較、分類その他の解析を行うこと」と定義しています。 – 著作権法第30条の4 – Wikibooks
  2. 文化庁の整理では、AI開発・学習段階と生成・利用段階では利用行為も適用条文も異なるとされ、享受とは音楽や映画なら鑑賞、文章やプログラムなら閲読や実行を指すと説明されています。享受目的が併存する場合には30条の4は適用されません。 – 「AIと著作権に関する考え方について」の要点を明快に示した概要版を公表 文化庁
  3. 意図的に特定のイラストレーターや作家の作品のみを大量に収集し、その表現スタイルの模倣に特化したモデルを構築する行為は、権利者のライセンス収入の機会を奪い市場で直接競合するため、但し書きに抵触する可能性が指摘されています。 – 著作権法第30条の4の基本構造と生成AI学習の適法性
  4. 文化庁は、判例および裁判例の蓄積がないという現状を踏まえて考え方を整理したと明記しています。2024年3月15日に法制度小委員会が取りまとめた文書です。 – AIと著作権について | 文化庁
  5. 2025年6月23日のアルサップ判事の判断は、新しい出力を返すためにLLMを訓練する目的での書籍利用を変容的でフェアユースとする一方、海賊版の複製で恒久的な蔵書を作った点は侵害としました。 – Landmark Ruling on AI Copyright: Fair Use vs. Infringement in Bartz v. Anthropic
  6. この集団訴訟は約50万点の作品を対象に15億ドルで和解し、判決ではなく和解のため先例としての拘束力は生じないとされています。 – Judge signs off on Anthropic’s $1.5bn book piracy settlement
  7. 著作権法2条1項1号は著作物を「思想又は感情を創作的に表現したものであつて、文芸、学術、美術又は音楽の範囲に属するもの」と定義しています。 – 著作権法 第一章 総則 第一節 通則
  8. 10条3項の規約はインターフェースやプロトコル、解法はアルゴリズム、つまりコンピューターに対する指令の組合せの方法を指すと説明されています。 – プログラム言語、規約、解法の著作権法による保護
  9. 日本の著作権法が定める財産的な権利は複製権だけではなく、翻案権や公衆送信権、上演権など複数の支分権の集まりとして構成されています。 – 著作権法 – Wikipedia
  10. 拡散モデルの原型であるDenoising Diffusion Probabilistic Modelsは、訓練時に元画像へガウスノイズを加えた画像を作り、そこから元を推定する働きを学ばせるもので、概念としては画像のノイズ除去器だと説明されています。 – Extracting Training Data from Diffusion Models
  11. 生成・利用段階では通常の著作権法が適用され、既存の著作物との類似性と、それを基にしたという依拠性の2点が認められた場合に侵害となり得ます。 – 生成AIの著作権ルールまとめ|文化庁の見解や商用利用のリスク
  12. 文化庁の考え方は、AIが学習データからパターンやルール、傾向等を抽出して生成する仕組みを前提に、開発・学習段階と生成・利用段階を分けて条文の適用を示しています。 – 生成された文章や画像 AIの著作権はどうなっているのか、文化庁の見解を知る
  13. GPT-2に対する実験で、ブラックボックスの問い合わせだけから訓練データの文字列を数百件そのまま復元できることが示されました。 – Extracting Training Data from Large Language Models
  14. 生成とフィルタリングを組み合わせた手法で、最先端の画像生成モデルから千件を超える訓練画像が抽出され、拡散モデルはGANより記憶が起きやすいと報告されています。 – Extracting Training Data from Diffusion Models
  15. 正式名称は「学問の奨励のための法律」で、未刊行の書籍については14年、著者が存命ならさらに14年、既刊書については21年という期間限定の権利を定めました。 – Statute of Anne, London (1710)
  16. 1787年にマディソンが提案した限定期間の著作権保護が、合衆国憲法第1条第8節の知的財産条項につながり、1790年の連邦著作権法へ実装されました。 – U.S. Copyright Beginnings | U.S. Copyright Office
  17. ベルヌ条約6bis条は、経済的権利とは独立に、またそれを譲渡した後でも、著作者が著作者であることを主張し、名誉や声望を害する改変等に異議を申し立てる権利を持つと定めています。 – Berne Convention, as revised – Article 6bis
  18. 1条は文化の発展への寄与を目的とし、公正な利用への留意と権利保護をその達成手段として位置づけていると解説されています。 – 著作権法第1条 – Wikibooks
  19. 27条は、1項で文化生活への参加と芸術鑑賞、科学の進歩の恩恵を受ける権利を、2項で自らの創作した科学的・文学的・美術的作品から生ずる精神的および物質的利益の保護を受ける権利を定めています。 – 世界人権宣言テキスト | 国連広報センター
  20. 5つのデータセットを用いた事前登録の追試では、投稿に道徳的・感情的な語が1語増えるごとに共有数の期待値が17パーセント増えるという結果が出ています。 – Estimating the effect size of moral contagion in online networks
  21. 5つの研究室による27件の研究、約482万件のメッセージを対象としたメタ分析でも、道徳的感情の伝播は一貫して確認されています。 – Estimating the effect size of moral contagion in online networks | PNAS Nexus