AuK 用に生成されたヒーロータイトルカード。ワードマーク「AuK」が「Tencent のオープンソース 1.5B 音声モデル」と「あらゆるオーディオタスクに 1 つの自然言語命令 — クローン作成、編集、強調、分離」というサブタイトルの上に表示されている。柔らかな青い波形が細いテキストカーソルのキャレットで編集中の様子とともに、Voice Clone、Edit、Enhance、Separate とラベル付けされた 4 つのフラットアイコンが描かれ、右下隅には OrcaRouter のロゴが合成されている。
Guides & Insights

AuK:Tencent、あらゆる音声タスクをテキストコマンドとして扱う1.5B音声モデルを静かにオープンソース化

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

今日ダウンロードできるどの音声ツールも、一度の処理では実現できないタスクがあります。すなわち、この録音を取得し、「house」という単語を「home」に置き換え、ピッチを半音上げ、最後のフレーズの前の呼吸音を取り除き、背景ノイズを除去し、そしてその結果を「少し広東語なまりのある温かい中年男性」とだけ説明された新しい声で読み直す、というものです。そのようなタスクに対するTencentの答えがAuKです。AuKは15億パラメータの「音声生成・編集のための基盤モデル」で、今週、ローンチ告知もプレスリリースもなしにオープンソース化されました。そして、その蒸留版の兄弟モデルであるAuK-Flashには、私たちが初めてこの記事を書いたときに欠けていたものが今付属しています。それは、数値が添えられたテクニカルレポートです。「AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing」(arXiv:2609.08936、cs.SD、2026年9月8日提出) は現在、Hugging FaceのモデルカードとGitHubのREADMEの両方で引用されています。論文のリスト日付は2026年9月8日、コードリポジトリのニュース行は2026年9月9日となっています。しかし、このレポートが解決していないのは、重要だった疑問です。レポート内のすべての数値はTencent自身によるもので、Tencentが選んだベースラインに対して実行されたものです。2026年9月10日時点で、社外の誰もその数値を一つも再現していません。

これは、これまでに判明している情報をまとめた記事で、改訂版です。Tencentは、私たちが確認できる主要なチャネルのいずれにおいても、いまだAuKを発表していません。したがって、記録は次の通りです:AuKおよびAuK-FlashのHugging Faceモデルカードとリポジトリ、Tencent-Hunyuan組織傘下のコードリポジトリ、auk-project.github.ioのプロジェクトサイト、そして今回の論文です。この最後の追加により、知り得ることは変わりました——アーキテクチャ、トレーニングレシピ、評価数値が初めて詳細に記述されたのです——検証済みの内容は変わりません。以下に示す数値はすべてベンダー報告によるものとして扱ってください。実際にその通りだからです。また、この報告書の比較はすべて他のオープンモデルとの比較であり、AuKが実際に競合するであろうクローズドなホスト型音声プラットフォームとの比較ではないことに留意してください。

実際に何がリリースされたのか、そしてそれがどれほど静かに行われたのか

タイムラインは依然として今回のリリースを最も正直に要約しているが、最初の確認から1点修正がある。Hugging Face リポジトリは8月中旬に作成された(AuK は2026-08-18)が、今週まで休眠状態だった。2026-09-09にAuKのモデルカードを確認した時点では、ニュース欄には2026-09-07付の項目が1件だけあった。しかしその1日後には、同じ行が2026/09/09となっており、論文とデモ用Spacesへのリンクが張られている。推論コードとトレーニングコードを格納したGitHubリポジトリは2026-08-19に作成され、最後のプッシュは2026-09-09だった。つまり、重み、コード、テクニカルレポートの順に、4日間で3段階に分けて公開されたが、執筆時点でTencentの主要チャンネルからの公式発表はまだない。

• ウェイトはHugging Faceのtencent org配下にあり、ModelScopeのTencent-Hunyuanにもミラーされています。2つのミラーは同じMITライセンスです。

• 各モデルリポジトリには、単一のsafetensorsチェックポイント、設定ファイル、およびVAEが格納されています。AuKの場合、auk_base.safetensors(6.12 GB)とvae.safetensors(0.64 GB)です。AuK-Flashも同じレイアウトです。モデルカードには、Qwen/Qwen2.5-Omni-3B(AuKが実行時に別途ロードするテキストエンコーダ)もダウンロードするよう記載されています。

「誰も気づかなかった」という枠組みは、あっという間に失効した。2026-09-09に確認した時点では、コードリポジトリのスターは0、フォークも0のままであったが、2026-09-10までにはスター216、フォーク12、そして最初のオープンイシューが表示されている。AuKカードには、先月のダウンロード数が約30件、いいねが26件と記載されている。変わっていない点:ディスカッションタブは空のままで、カードには依然として「チェックポイントはどの推論プロバイダーによってもデプロイされていない」と記されている。

• モデルカード、README、および論文リンクのデモSpacesは、Hugging FaceとModelScopeの両方にあります。確認した時点では、Hugging Face Spaceはサインインなしでは公開アクセスできなかったため、「ブラウザで試す」パスは匿名ユーザーにとって未確認として扱ってください。

A screenshot of the Hugging Face model page for tencent/AuK, captured September 9, 2026, showing the Tencent org, the model name, the Text-to-Speech pipeline tag, model tags including zero-shot-tts, voice-cloning, speech-editing, instruction-guided and diffusion, the licence "mit", and the model card opening with "AuK: An Open-Source Foundational Model for Speech Generation and Editing", a News entry dated 2026/09/07 reading "AuK is now open-source. Code and model weights are publicly available.", and the start of the Introduction describing AuK as a 1.5B foundation model.

上記のHugging Faceカードは、依然としてインストール可能なリリースの公開された表面のすべてです。モデルカード、コンフィグ、2つのsafetensorsファイル、そしてライセンス。それ以降に追加されたものは、その周囲のドキュメント層――論文、ベンチマーク表、引用ブロック――であり、それらのいずれも、背後に変更履歴もディスカッションスレッドも推論プロバイダーの一覧も存在しないという事実を変えるものではありません。

コンセプト:1つの命令インターフェースで16種類の音声タスクを実現

AuKの主張は、これまでにリリースされた中で最高のテキスト音声合成モデルであるということではない。そうではなく、音声生成は、このモデルが単一の自然言語インターフェースを通じて実行するよう訓練された5つの音声タスク群のうちの1つにすぎない、というものである。そこでは、リクエストはチャットメッセージであり、テキストに加えて任意の参照音声ファイルを保持できる。論文は、プロジェクトサイトがすでに宣伝していた分類法を正確に形式化している。

• 音声生成 — ゼロショットTTS(このテキストを参照クリップの声で読み上げる)およびインストラクションTTS(参照音声を一切使わず、音声の説明だけで音声を生成する)。

コンテンツ編集:既存の録音内の言葉を書き換える機能で、単語の置換、挿入、削除が可能です。また、歌詞編集は、メロディーと声を保ったまま歌詞を書き換える機能です。

• 音響編集 — 半音単位のピッチ、話速のスケーリング、デシベル単位の音量。

• パラ言語的編集 — 感情の変更、記述に基づく音色の変更、アクセント除去、非言語音(呼吸、笑い、咳)の追加または削除、話者を維持したまま通常の音声とささやき声の間の変換。

• 強調と分離 — 音声のノイズ除去と残響除去、発話順序による音声分離、音楽/ボーカル分離、および話者の発話内容によって識別される目的話者抽出。

指示型TTSのケースは、これを典型的な音声クローニングリリースから際立たせる点です。AuKは、テキストによる説明としてのみ存在する声で文章を読み上げます。ドキュメント自体の例では、二十代の女性が、ちょうど帰宅したパートナーに話しかけるという設定で、温かく思いやりがあり、軽く色っぽい、柔らかく甘い音色で、文末がわずかに上がる調子を指定しています。しかも、参照クリップは一切添付されません。これにより、参照録音が不要になります。参照録音は通常、クローニングを行う際の障壁となるコストです。このレポートは、そのタスクに初めて数値を提示したものであり、AuKが他を僅差で上回るのではなく、完全に凌駕する数少ない分野の一つです。

「1.5B」の内部:その数値はランタイムの実態を過小評価している

AuKのパラメータ数は拡散トランスフォーマーについて述べたものであり、パイプライン全体を指すわけではない。論文では現在、両方の部分が明示されている。バックボーンはハイブリッドな整流フローTransformerであり、10個のデュアルストリームMMDiTブロックとそれに続く20個の統合シングルストリームDiTブロックからなる30層で、隠れサイズ1536、次元64のアテンションヘッド24個、SwiGLU中間幅3072を備えており、「約15億パラメータ」という数字はここに由来する。その周囲には、個別に読み込まれる2つのコンポーネントが存在する。命令文と任意の参照オーディオを意味的条件付けに変換するマルチモーダルLLM(Qwen/Qwen2.5-Omni-3B)、および、因果的24kHzオーディオVAE — 構成名ではBigVGANFlowVAE — であり、これは50Hzのフレームレートで64次元の潜在変数を実行し、エンコーダのチャンネル幅は最大768、デコーダは最大1536である。したがって、完全なランタイムは、約15億のバックボーンに加えて30億のエンコーダ、そしてVAEから構成され、ダウンロードの指示には、エンコーダが独自の利用条件を持つ別個のチェックポイントであることが明記されている。

レポートによると、トレーニングは段階的に、そしてプロジェクトサイトがほのめかすにとどまっていた規模で実施された。{{1}}生成のみのウォームアップとして5万回の更新、続いて生成と編集を組み合わせた60万回の更新が、約30.3億件の命令音声インスタンス(約195万時間の実効的教師信号に相当)に対して、256基のGPUを使用して行われ、さらにVAEには124万回の更新が行われた。{{/1}}ポストトレーニングでは、人間フィードバック選好最適化と報酬ベースの強化学習を組み合わせ、{{2}}818の有益な選好グループと9,080の評価済み候補、1万のゼロショット・プロンプトと5千の指示追従プロンプトからなるRLプロンプトプール、3万のスタイル判定サンプル、そしてQwen2.5-Omni-7Bからファインチューニングされた報酬モデルに基づいていた。{{/2}}1.5Bのオープンリリースとしては本格的なポストトレーニングスタックであり、「オープンウェイト」が指すのは成果物であって、それを生み出した計算リソースではないということを思い出させるものでもある。再現できるかどうかを検討する際に心に留めておく価値のある点だ。

A generated single-column scoreboard for AuK listing Params: 1.5B backbone + 3B Qwen encoder; License: MIT; Open-sourced: 2026-09-07 weights · 2026-09-09 code; Tasks: 16 across 5 speech families; Runtime: 24 kHz · 50 Hz audio latents; AuK-Flash: 4-step, no CFG, 4.5× faster (vendor), with the footer "Specs from Tencent's repos & project site; vendor-reported, not independently reproduced yet." and the OrcaRouter logo composited in the bottom-right corner.

そのスペックシートのすべての数値は、私たちが測定したものではなく、Tencent自身のリポジトリとウェブサイトから読み取ったものです。論文はそれを変えませんでした — 単にそれらの項目の多くを「主張」から「文書化」に移しただけです。私たちが最初に公開して以来、実際に検証された唯一の数値はリポジトリ自体のアクティビティで、スター数がゼロから1日で数百に増えました。

A screenshot of the AuK project website at auk-project.github.io, captured September 9, 2026, showing the title "AuK: An Open-Source Foundational Model for Speech Generation and Editing", badge links for GitHub, Hugging Face and ModelScope, the AuK-Flash variant name alongside Tencent Hunyuan co-branding, the tagline "One model for every speech task", and the opening description of AuK as a 1.5B-parameter foundational model with a multimodal language model, a 50 Hz VAE and a hybrid transformer under a flow-matching objective.

プロジェクトサイトは、アーキテクチャ図と学術的なコブランディングが置かれている場所であり、モデルの形状を把握する最も安価な方法であることに変わりはない。すなわち、セマンティック条件付けのためのマルチモーダル言語モデル、音響のための50Hz VAE、フローマッチング目的関数の下でのハイブリッドトランスフォーマーである。最初に見たときにはスコアのない評価装置がリストされていたベンチマークセクションには、今では参照すべき論文がある。

技術レポートが届き、その数字はTencent自身のものだ。

これがアップデートの実質的な内容です。論文は7つの評価スイートにわたる結果を報告しています。これはプロジェクトサイトが数字なしで宣伝していたのと同じリストであり、生成とコンテンツ編集のほとんどの軸で、AuKはオープン分野をリードしています。これらはベンダーのベンチマーク表として読むべきです。実際にそうだからです。テンセントがすべての比較を実行し、すべてのベースラインを選択し、ハーネスを再現するためのコードはまだ公開していません。

• Seed-TTS-EvalにおけるゼロショットTTS: AuKは平均WER 2.65、話者類似度0.795を達成。一方、Qwen3-TTSは3.07と0.745、Seed-TTSは3.65と0.778、VoxCPM2は3.65と0.767。AuK-Flashは2.85と0.790。最良の単一分割では、英語テストセットでWER 1.02、中国語ハードセットで5.91を記録。

• InstructTTSEvalにおける指示制御型TTS:AuKは中国語で83.37、英語の説明追従で81.60を獲得し、Qwen3-TTS-VDは81.10および82.40、MOSS-VoiceGeneratorは80.00および82.00でした。AuK-Flashは中国語で78.80ですが、英語では分野最高に並ぶ82.40を記録しました。

• SpeechEditBenchにおけるコンテンツ編集: 精度は91.83(Ming-UniAudioの76.46に対して)、韻律は71.33(同26.50に対して)— これはレポート全体で最も大きな2つの差です。

Ming-Freeform-Audio-Editにおける指示誘導編集のフル設定では、Ming-UniAudioと比較して、中国語の単語誤り率が10.46から3.09へ、英語では14.28から3.96へ低下し、編集精度は中国語で79.62から91.47へ、英語で70.98から85.25へ向上しました。音響編集では、同じ比較において中国語の単語誤り率が5.01から2.02へ、英語では10.75から3.48へ改善されました。

• MMAE-Speech におけるパラ言語的編集: 指示追従率 48.23、コンテンツ書き換え 88.11。一方、Step-Audio-EditX は 43.52 と 77.27、Ming-UniAudio は 34.13 と 76.01。AuK-Flash は表内で最高の編集モデル再現率 13.85 を記録。

• 復元では、モデルは支配的ではなく競争力のある結果を示した:非同期DNS Challengeではワードエラー率2.66(話者類似度0.99)でRE-USEの3.31に対し、CHiME-4ではワードエラー率7.98でRE-USEの10.71に対し、Libri2Mixではワードエラー率9.12でMossFormer2-SSの9.34に対し、VCTKSRではワードエラー率3.06(類似度0.97)であった。

• VAE自体を単独で評価すると、AuK-VAEは音声で4.143、一般的なオーディオで3.833、音楽で3.884のPESQを達成し、MiniMax-H3-AudioVAEの3.633、2.835、2.801に対して完全勝利となった。これは見た目以上に重要である。なぜなら、非可逆な音響潜在表現は、その上に構築されるすべてのタスクの上限を決めてしまうからだ。

これらの箇条書きに共通するパターンは、派手な勝利そのものよりも興味深い。AuKは、「発話内容や音声の聞こえ方を変更し、それ以外はすべて維持する」という意味のあらゆるタスク(コンテンツ編集、韻律、音響編集、再構築)で大きくリードしている。一方、感情およびパラ言語的編集では、AuKは他モデルとの差がはるかに小さい。両者とも低成績だったSpeechEditBenchの感情精度において、AuKの9.94はMing-UniAudioの3.43とほとんど大差なく、総合音響スコアの37.07もベースラインと同程度の範囲に収まっている。つまり、「あらゆる音声タスクのための単一モデル」というのはTencentの枠組みにすぎず、レポートが実際に示しているのは、いくつかのタスクでは優秀だが、残りのタスクでは単に存在するだけの単一モデルである。

2つのチェックポイント: AuK と AuK-Flash

Tencentは同じMITライセンスの下で2つのバリアントをリリースした。AuKはフルクオリティのベースモデルであり、レポートではそのサンプリング設定を分類器フリーガイダンススケール2.0、32回の関数評価と定めている。AuK-Flashは蒸留版であり、一貫性初期化(consistency initialisation)とタスクルーティングされたDecoupled DMD目的関数を採用し、ガイダンスを完全にオフにして4つの固定ステップで生成する。論文ではこれを、同等条件下でのフルモデルに対する4.5倍のウォールクロック高速化として報告している。論文自身の数値によれば、Flashはほとんどの生成タスクで高い性能を維持しており(Seed-TTS-Evalで平均ワードエラー2.85、類似度0.790)、このことが、速度の主張を退けるのではなく検証する価値を生んでいる。教師モデルに近い品質での4ステップ拡散が実現すれば、1.5Bの音声エディタが単一GPU上でインタラクティブに感じられるようになるからだ。とはいえ、「同等条件(matched conditions)」はTencent自身のベンチマークを説明するTencentの表現であり、著者らが測定した4.5倍という数字は、調達決定を変える前に第三者による検証が必要な類の主張そのものである。

今日実行できるもの

実用面は、よくある静かなウェイト公開よりも広い。コードも同時にリリースされたからだ。インストールはuvまたはConda経由でPython 3.10を対象としており、READMEにはGradio、ComfyUIノード、ファインチューニングスタックを導入する追加のインストール先も用意されている。コマンドラインツールのauk-inferは、すべてのタスクを同じメッセージ形式で処理する。--instructionは常に必須で、--audioはタスクに応じて任意である。Gradioサーバー(auk-gradio)はセレクター付きでモデルを公開し、再利用可能なワークフローを備えたComfyUIカスタムノードもある。ただし、この統合はソースとターゲットを合わせたシーケンスが30秒までという制限付きでドキュメント化されている。Python APIはCLIをミラーリングしており、軽量なファインチューニングパイプラインは、推論と同じメッセージ形式で、指示と音声のペアからなるJSONLを学習データとしてトレーニングを行う。READMEには、自由形式のリクエストをそのまま実行可能なauk-inferコマンドに変換するPrompt Enhancerの説明もある。これはOpenAI互換のチャットエンドポイントを前提としており、クラウドASRの認証情報が設定されていない場合は、音声認識にローカルのSenseVoiceSmallモデルへフォールバックする。現在の制限がひとつ、明確に記載されている。Qwen3-Omniはエンコーダーパスとしてまだサポートされておらず、ダウンロードすべきチェックポイントは引き続きQwen2.5-Omni-3Bである。

ドキュメントが依然として示していないのは、ハードウェアの下限です。推論時のVRAM容量は公表されていません。設定ファイルには勾配チェックポイントに関する注記があり、約91GBのピークが約75GBに低下することが書かれていますが、これは現実的な単発推論の数値ではなく、トレーニング時のメモリ範囲を示したものです。また、AuKとAuK-Flashをまとめてロードするリファレンスコマンドは両方を2つのGPUに分散させますが、両者で1つのGPUを共有できるとも注記されています。ダウンロード自体の容量も見積もってください。各バリアントで約6.8GB、それにQwen2.5-Omni-3Bエンコーダーが加わります。その後は、お使いのGPUでメモリを測定してください。

何が確認されていないのですか

未知のものについて正確であることが、これほど早い段階でモデルを取り上げる意義であり、その報告書はこのリストからちょうど1項目を削除し、残りは無傷のまま残した:

• 私たちが確認できる限り、独立した実行は存在しません。第三者の音声サンプルも、ベンチマークの再現も、ディスカッションスレッドでの感想もありません。リポジトリの最初のオープンイシューは投稿されたまま未回答で、モデルカードのダウンロード数もまだ数十件です。つまり、公開されたテーブルと再現されたテーブルの間の隔たりが、現在のところすべてを物語っています。

• この評価は自己実施であり、ある特定の点で視野が狭い。レポート内のすべてのベースラインは、いずれもオープンウェイトのモデル—Qwen3-TTS、Seed-TTS、VoxCPM2、Ming-UniAudio、Step-Audio-EditX、MOSS-VoiceGenerator、RE-USE、MossFormer2-SS—である。購入者が実際にAuKと比較衡量するであろうクローズドなホステッド音声プラットフォームは一切登場していない。したがって、ここでの「業界をリードする」とは「Tencentが選定したオープン分野をリードする」という意味にすぎない。

• 「AuK」という名前は、今も論文・カード・コードのどこにも展開されておらず、検索では海鳥やアメリカン大学クウェート、無関係のリポジトリと大きく衝突します。

チームは今や少なくとも姿が見えてきた——論文にはZiyang Ma氏が率いる33人の著者が名を連ね、その所属はTencent Hunyuan組織、上海交通大学、上海革新機構、南洋理工大学にわたる——だが、Tencent内部で誰が日常的にモデルを担当しているのか、またそれがHunyuan系なのか独立した学術協力なのかは、依然として明記されていない。

• 言語カバレッジはまだ部分的にしか文書化されていない:AuK-Flashカードは中国語と英語を宣言しており、コード例は両方を混在させているが、ベースモデルには正式な言語リストがない。ライセンスも同様の状況である — AuK自体はMITライセンスだが、別途ダウンロードされるQwenエンコーダーは独自の利用条件を有しているため、「MITモデル」と「実行に必要なすべてがMIT」は同じ意味の記述ではない。

統一されたオープンウェイト音声モデルが重要な理由

AuKのタスクリストを、実際にビルダーが今日行っている作業と照らし合わせると、数字が出る前よりもその賭けの意味は明確になる。既存のツールでこれらすべての作業を行うには、複数の専門モデルを連鎖させる必要がある(クローンニング用のオープンチェックポイント、エンハンスメント用の別のモデル、分離用のさらに別のモデル、コンテンツ編集用の手動またはモデル支援による編集)、あるいは複数のクローズドなホステッドAPIをレンタルする必要がある。各APIはタスクごと、オーディオの分数ごとに課金され、AuKが説明するような編集はどれもできない。これらすべてを単一のテキスト条件付き生成問題として扱う単一のオープンウェイトチェックポイントは、本質的に異なる対象であり、レポートはマーケティングよりもシャープなバージョンの主張を裏付けている。編集の半分は現実のものであり、空想ではない。音声クローニングはこの1年でコモディティ化されたが、指示駆動型のコンテンツ編集と韻律編集こそ、クローズドなホステッドプラットフォームがまだ利益を上げている分野であり、コンテンツ編集で91.83対76.46というスコアは、オープンモデルがその領域を獲得できることを示す最初の証拠である。

正直な評価を述べると、これは3B言語モデルをコンディショニング用に追加した拡散モデルであり、その構造に由来するコストを受け継いでいます。タスクごとの品質は不均一で、「編集部分以外はすべて保持する」タスクでは優れていますが、感情表現では薄味になります。また、ホスト型エンドポイントはなく、バッチ処理の仕組みもなく、Flashバリアントの内部比較以外に公表されたレイテンシもありません。その周囲の音声パイプラインの構成要素、つまり「何を話すべきか」を決定するLLMと、Prompt EnhancerのOpenAI互換チャットエンドポイントには、ルーティングAPIが自然な適合であり、OrcaRouterは200以上のモデルをプロバイダー定価・マークアップなしで提供するため、スタックのその半分は1つのキーと追加契約を不要にします。音声側は依然として、あなたが管理するGPUと、Tencent外部の誰も監査していないチェックポイントに依存しています。

今見るべき人は誰か、そして待つべき人は誰か

音声研究者、ツール開発者、そして新しい音声モデルの評価を仕事とするすべての人にとって、今週AuKをダウンロードする根拠は初日よりも強くなっており、それと同時に同じ注意点も伴っています。文書化されたアーキテクチャ、再現可能に見えるレシピ、そして打ち破るべきターゲットの完全なテーブルが手に入ります。これこそが、再現されていない主張を攻撃する価値がある理由です。早期に採用するコストは、依然として週末のセットアップとGPU1台分です。本番用の音声スタックを選ぶ人にとって、このレポートは決定の形を変えるものの、決定を確定させるものではありません。議論の対象となる数値はありますが、それはベンダー側のものであり、実際にベンチマークすることになるクローズドなプラットフォームを除外しており、まだAPIもVRAMの最低要件も実績もありません。順に注目すべきことは、Seed-TTS-EvalとSpeechEditBenchの行の独立した再現、公開されたサンプルまたはアクセス可能なデモスペース、そしてAuKを採用する推論プロバイダーまたはホステッドAPIです。その時点で、当社側のパススルー価格はプロバイダーのリスト価格と同日になります。それが0%マークアップの意味だからです。興味深い問題は、もはやTencentが別のTTSモデルを出荷したかどうかではなく、1つのオープンモデルが本当にこれら5つのタスクファミリーすべてを同時に担えるかどうかです。そして今やTencentが自社の回答を公開した以上、残された唯一のことは、他の誰かがそれを検証することです。