Home
Language
English
Türkçe
Bahasa Indonesia
About
Privacy Policy
Terms of Service
Pricing
Sign In
Download All
Share
ZAORIKU, D.M
@zaoriku0
マルチエージェント・システムとか自然言語処理, phD(Eng) 創発系: AIバリューチェ~ン/仮想企業/ネットワーク組織, 分散人工知能: DAI/ABM/MAS/ML/RL/NLP, ガンダム, Python/R/Java/Android/Perl/Ruby/C#等,
東京, white outlier
Joined September 2009
2.8K
Following
1.4K
Followers
29.8K
Posts
Pinned Tweet
ZAORIKU, D.M
@zaoriku0
over 8 years ago
久しぶりにやったら、ちょっと変わってる。
#あなたをフォローしているクラスタTOP10
1位 機械学習 2位 自然言語処理 3位 人工知能 4位 勉強会 5位 データマイニング 6位 ソーシャルメディア 7位 データサイエンティスト 8位 データサイエンス 9位 コンサル https://t.co/ohT0m6YVqh
zaoriku0
retweeted
Itaru Tomita / 冨田到
@itarutomy
3 days ago
GraphRAG(文書から知識グラフを作って検索するRAGの発展形)を作るには巨大なLLMが要る、というのは思い込みらしいと分かる論文が出た(https://arxiv[.]org/html/2607.11683v1)。 LLMがパイプライン内でやる仕事、つまり文中の人名や製品名などの固有表現(エンティティ)を抽出したり文脈から関係を推論したりす���作業は「言語スキル」であり、「世界知識(雑学的な事実をどれだけ知っているか)」とは別物だという。世界知識はモデルを大きくするほど伸び続けるが、言語スキルは比較的小さなモデルで早々に頭打ちになる。実際Qwen2.5系列を0.5Bから72Bまで拡大すると、世界知識クイズはF1が21.1ポイント伸びた一方、答えが全部文脈中に書いてある問題では4ポイントしか伸びなかった。 この発見をもとに専用チューニングした7Bのモデル「Meno-Lite-0.1」は、知識グラフ構築タスクの総合スコアで32BのQwen2.5-32Bを12.5%上回る。パラメータ数は4分の1以下である。 あわせて発表されたGraphRAGエンジンRAGUは、エンティティ抽出と統合処理(重複除去・要約・グラフを意味のあるまとまりに分割するコミュニティ検出)を分ける設計でノイズの少ないグラフを作る。医療分野のベンチマークでは答えの根拠を漏れなく拾える割合(エビデンス想起率)が全難易度で最高値(最大84%、既存手法は76%)。単純な一問一答ではHippoRAG2という既存手法が上だが、幅広い文脈をまとめる生成タスクでは逆転する。 もう一つ面白いのが、マルチホップQA(複数の情報を辿って答える問題)で見つかった見かけ上の差だ。素の生成プロンプトだと既存手法が圧勝して見えるが、正解が短文なのにRAGUの回答が長文になりがちという回答形式の違いが原因だった。回答を簡潔にする条件を揃えると、BioASQというベンチマークでRAGUがわずかに逆転し(72.9対72.4)、2WikiMultiHopQAでの差も19.3ポイントから5.5ポイントまで縮まる。 シングルGPUで1文書あたり0.001ドル、商用APIを使う既存手法(1文書0.10ドル)の100分の1のコストで動く。pip install graph_raguでMITライセンス公開済み。
See More
ZAORIKU, D.M
@zaoriku0
4 days ago
やべー買っちゃう
ガンダム公式
@gundam_info
4 days ago
『機動戦士Ζガンダム』外伝「TYRANT SWORD Of NEOFALIA タイラント・ソード」が9月30日発売���定!ホビージャパンの人気連載を超高解像度スキャンでまとめた1冊! https://t.co/VpfxAb5kIW
ZAORIKU, D.M
@zaoriku0
4 days ago
名前が日本語とアルファベットの違いあるな…
Who to follow
xiangze
@xiangze750
FPGA,画像処理,機械学習,ベイズ統計, 最適化問題や���連する数学に興味がありま��。読んだ論文まとめ https://t.co/BKIQ903eFP
なない
@nanay_desu
ぽんぽこMLエンジニア DMはお気軽���
しゅんけー「📕Pythonで学ぶ画像生成」発売中!
@shunk031
Shunsuke Kitada, Ph.D. Research Scientist. ex-彌冨研, 学振DC2 | CV, NLP, V&L | #しゅんけー画像生成本 インプレス社 発売中 https://t.co/W0vPPTZAY5 | ENTP/LCRO🐉 | @cgd_lab お仕事の依頼はDM��て
ZAORIKU, D.M
@zaoriku0
4 days ago
がーん。30分以上レビューしてる汗
ZAORIKU, D.M
@zaoriku0
4 days ago
Accelerating scientific discovery with ChatGPT for Academic Researchers 出してみた
zaoriku0
retweeted
Maxwell! 🌃 🌻 🐇 ☃
@Maxwell_110
4 days ago
Kimi 3 でも使われている Delta Attention を一度おっかけておきたいと思っていたところ,ふと知ったこのサイトが良かった https://t.co/dacR3DvTD1 Pytorch でスクラッチで実装して,複数テストケースで通るかどうかを確認することができる. しかし,毎回次元のエラーで苦労するな(´(ェ)`)
ZAORIKU, D.M
@zaoriku0
4 days ago
おお、地震の断層 https://t.co/nJnNqCpNJp
ZAORIKU, D.M
@zaoriku0
4 days ago
S言語の話を久しぶりに聞いた S言語を日本に導入とか話されてる方 R勉強会にいなたような… おぼろげ
ZAORIKU, D.M
@zaoriku0
5 days ago
https://t.co/FEHme0OUtQ このあたりも近そう 先輩筋
ZAORIKU, D.M
@zaoriku0
5 days ago
共通ルールの創発 ピジンとかいうのを扱うマルチエージェント 昔あったな
ZAORIKU, D.M
@zaoriku0
5 days ago
https://t.co/Tvy3jeGXHh あ、やっぱ内海研がらみ
zaoriku0
retweeted
Yo Ehara
@yo_ehara
5 days ago
プログラ���ング言語を人間が書かなくなってきたのでAI用の言語が出てくると…
zaoriku0
retweeted
Daisuke Okanohara / 岡野原 大輔
@hillbig
6 days ago
Kimi K3は、フロンティアモデルに匹敵する性能を持つオープンウェイト��デルである。Technical Reportが公開されたので、重要な点をまとめる。 Kimi K3は、総パラメータ数2.8T、活性パラメータ数104BのMoEモデルである。アーキテクチャ、データ、ハイパーパラメータ、学習手法を総合的に改善し、Kimi K2と比べて、同じvalidation lossに到達するために必要な学習計算量を約2.5分の1にしたと主張している。 * アーキテクチャ Kimi K3のアーキテクチャは、系列方向、深さ方向、幅方向という三つの情報流を、それぞれ拡張するように設計されている。 系列方向では、Kimi Delta Attention(KDA)とMulti-head Latent Attention(MLA)を組み合わせる。モデル全体は93層からなり、基本的には3層のKDAと1層のGated MLAを一つのブロックとして繰り返す。 KDAは、過去の履歴を固定サイズの状態行列へ圧縮する線形アテンションである。従来のDeltaNet系の構造を拡張し、過去の情報をどの程度保持するかをチャネルごとに調整できる。 KDAの基になったKimi Linearでは、忘却率が極端に小さくなる可能性があり、チャンク並列計算において累積減衰の逆数が過大になり、オーバーフローなどの数値不安定性を引き起こす問題があった。Kimi K3では、対数減衰に下限を設けている。 この変更により、以前は特殊なposition-pair計算が必要だった対角タイルも、Tensor Core上の密行列積として処理できるようになった。数式上は小さな変更だが、GPUカーネルを単純化し、学習速度を改善する重要な工夫である。 MLA層では、RoPEなどの明示的な位置符号化を使っていない。Kimi Linearでも示されていたように、位置や順序に関する情報は主にKDA側が担い、MLAは主として内容に基づくグローバルな情報検索を担当する。 この役割分担によって、コンテキスト長を拡張する際に、RoPEの周波数調整や補間を行う必要がない。 ただし、位置符号化の変更が不要だからといって、学習なしで100万トークンを利用できるわけではなく、Kimi K3は、8K、64K、256K、1Mと段階的にコンテキス��長を伸ばして学習している。 技術報告では、8Kから64Kまでをpre-training中に実行し、学習の最終段階であるcooldownにおいて256K、1Mに拡張したとしている。 次に特徴的なのが、深さ方向の情報流を改善するAttention Residualsである。 通常のTransformerでは、過去の層の情報が残差接続によって順番に加算され、一つのhidden stateへ集約される。深さ方向で見ると、過去の情報を単一の状態へ圧縮していくRNNのような構造になっている。 Attention Residualsでは、各層が過去の層やブロックの表現に対してattentionを行い、必要な深さの表現を選択的に取得する。 この実現にあたり、各層は、学習可能なpseudo-queryベクトルを持つ。このqueryは入力から計算されるのではなく、層ごとに保持される学習可能なパラメータである。一方、keyとvalueには、各入力トークンに対する過去の層出力が使われる。 pseudo-query��、「この層がどのような種類の表現を必要としているか」を表す検索テンプレートとみなせる。query自体は入力に依存しないが、keyは入力に依存するため、実際のattention weightはトークンごとに変化する。 ���立した学習可能ベクトルをqueryとして使うことで、各トークン、各層について大きなquery projectionを計算する必要がなくなる。また、Attention Residualsによって作られる現在層への入力からqueryを生成しようとした場合に生じる循環依存も避けられ、実装が単純になる。 Kimi K3では、全93層をおおむね12層ずつのブロックに分け、過去の全層ではなく、主としてブロック単位の表現にattentionするBlock Attention Residualsを用いている。これにより、過去の全層出力を保持するためのメモリと、pipeline parallelism時の通信量を削減している。 幅方向では、Stable LatentMoEを用いる。 Kimi K3には896個のrouted expertがあり、各トークンについて16個が選ばれる。ただし、各expertへ7168次元のhidden stateをそのまま送るわけではなく、expertへ入る前に3584次元のlatent空間へ圧縮し、expert処��後に元の幅へ戻す。一方、全トークンに共通して使われる2個のshared expertは、元の全幅で動作する。 Kimi K2では384個のrouted expertから8個を選択していたのに対し、Kimi K3ではexpert候補数が約2.3倍、同時に活性化するexpert数が2倍になっている。sparsity ratioはKimi K2の48に対してKimi K3は56であり、似たレベルである。より多くの専門的なexpertを組み合わせながら、latent空間を使うことで計算量と通信量を抑えている。 さらに、routed expertの集約後にRMSNormを挿入し、SwiGLUの代わりにSiTU-GLUを導入している。SiTU-GLUは、SwiGLUの原点付近における性質を保ちながら、大きな入力をtanhによって滑らかに飽和させる。Kimi K3の設定では、各出力座標の絶対値が最大100に抑えられる。大規模かつ極端に疎なMoEにおけるactivation explosionを防ぐための設計である。 また、expert負荷の均衡にはQuantile Balancingを使う。 従来方式では、過剰に使われたexpertのbiasを少し下げ、使われていないexpertのbiasを少し上げる更新を繰り返していた。しかし、896個のexpertを扱う場合、このような固定幅の更新では追従が遅く、負荷が振動しやすい。 Quantile Balancingでは、各expertが目標数のトークンを受け取るように、router scoreのmarginの分位点から次のbiasを直���推定する。 実際には、全marginを一箇所へ集めるのではなく、expertごとのhistogramをall-reduceし、全体の分位点を近似する。 さらに、Kimi K3は画像と動画を事前学習の段階から統合している。画像・動画のencoderには、約4億パラメータ、27層のMoonViT-V2を用いる。Kimi K3では、SigLIPなどで事前学習したvision encoderを接続するのではなく、vision encoderも言語モデルと同時にscratchから学習している。 技術報告では、SigLIPで初期化したencoderよりも、next-token predictionによってscratchから学習したMoonViT-V2の方がgradient normが安定し、最終的なvision評価も同等だったと報告している。 事前学習 === 事前学習は8K contextから始まり、その後64Kへ拡張される。さらに、学習の最終段階であるcooldownにおいて、256K、1Mへ伸ばしている。 一般的には4K~8Kなのに対し、64Kまでが事前学���の範囲とされているのが興味深い。どの規模でされたかの証明は示されていない。 自然な長文や動画には、重複、壊れたファイル、無効なlog、途中で切れたデータ、類似したframeの連続などが多く含まれる。��のため、長文専用のcleaning pipelineを用いて、重複除去、品質判定、構造検証を行う。 また、本当に長く一貫した文書や動画は短いデータに比べて少ないため、cooldownでは長文データを相対的にupsampleする。 ただし、長いsequenceを見せるだけでは、モデルが近くの情報だけを利用し、遠距離の情報を無視する可能性がある。そこで、複数の文書やsub-taskを並べ替えて連結し、100万トークンの中に分散した情報を集めなければ解けないような合成課題も作っている。 事後学習 === 事後学習は、SFT、RL、Multi-Teacher On-Policy Distillationの三段階で行う。 まずSFTによって、tool callingやagent trajectoryの基礎を学習する。 次に、general tasks、general agents、coding agentsという三領域について、それぞれlow、high、maxの三段階のreasoning effortを学習する。これにより、合計9個の���門policyが作られる。 まず、特定のエージェント実装への過学習を防ぐため、ツール、system prompt、memory、context management、subagentなどを交換可能な部品として構成する。Kimi CodeやClaude Code、Codexに近い形式だけでなく、未知の構成でも学習させることで、特定のハーネスに依存しない能力を目指している。 RL課題の生成には、自己拡張する知識グラフを利用する。数学、物理、化学、コンピュータ科学などの大分類から始め、エージェントがWeb検索を行いながら、より細かな概念へ分解する。そこから論文、ブログ、コードリポジトリなどを収集し、知識問題、コーディング、視覚推論などの課題を合成する。 学習対象は多岐にわたる。検索や法律、金融、データ分析などの専門業務に加え、画像をPythonでcrop、zoom、変換しながら解く視覚課題、CUDAやTritonを用いたGPUカーネル最適化なども含まれる。 また、Gmail、Slack、Notionなどを模した環境を構築し、複数日にわたるpersonal assistant課題も学習する。一つのrolloutが数千回のtool call、���百万context tokensに達することもある。 Autonomous Execution Tasksでは、正解手順を与えず、初期状態、目標、制約、ツール、実行予算だけを与える。モデルは自ら計画し、ツールを使い、失敗から回復し、最終状態を外部verifierに評価させる。公開verifierだけに過適合することを防ぐため、モデルには見えないhidden verifierも用いる。 Web開発では、Webサイト、ゲーム、3D、データ可視化、full-stack applicationなどを生成する。buildの成否、実行時error、機能、見た目、操作結果を評価し、画像を貼り付けただけの偽装などは報酬をゼロにする。 その後、9個の専門モデルを一つに統合するため、Multi-Teacher On-Policy Distillation(MOPD)を行う。 RL学習環境 === 長期エージェントRLでは、一つのtrajectoryが数百から数千回のtool callを含み、累積context tokensが数百万に達するこ���もある。 すべてのtrajectoryの終了を待つと、一部の非常に長いtrajectoryが学習全体を待たせる。そのため、一定割合のrolloutが完了した時点でpolicy updateへ進み、未完了trajectory��次のiterationで再開するpartial rolloutを使う。 未完了trajectoryを再開するには、モデル側のKV cacheと、外部環境側のsandbox stateの両方を保持する必要がある。 Kimi K3では、GPUからevictされた長いprefixをCPU DRAM上のexternal KV cache poolへ保存する。また、Firecrackerを用いたmicroVM sandboxであるAgentENVを使い、sandboxをpause、resume、fork、snapshotできるようにしている。 報告では、checkpointが最短133ミリ秒、resumeが最短49ミリ秒であり、学習と評価全体で約5122万個のsandboxが作成されたとしている。 学習基盤 === KDAでは、各sequence segmentの作用を、入力状態に作用するtransitionと、zero stateから生成される局所状態に分解する。 これらの変換は結合可能であるため、prefix scanによって各GPUに必要な初期状態を計算できる。 MoE学習にはMoonEPを用いる。必要に応じてexpertを別rankへ���的に複製し、すべてのexpert parallel rankが正確に同数のトークンを処理するようにする。技術報告では、各rankに最大E/R個のredundant expert slotを確保すれば、完全に���衡した割り当てが常に存在することを示している。ここでEはexpert数、Rはexpert parallel rank数である。 完全に負荷を均衡できれば、遅いrankを待つ時間がなくなるだけでなく、通信bufferや計算shapeを固定でき、各層でhost側へ同期してtoken数を確認する処理も不要になる。 推論 == 推論時には、KDAの固定サイズ状態と、MLAの系列長に比例するKV cacheを、同じpaged cache managerで管理する。 MLAは細かいtoken境界でprefixを再利用する一方、KDA stateは大きいため、conversation turnなどの限られた境界でcheckpointする。 投機的デコーディングでは、draft tokenごとに巨大なKDA stateを保存せず、小さなprojection inputだけを保存する。 draft tokenの一部がrejectされた場合は、acceptされた部分についてKDA stateをGPU上で再計算し、正しい状態へ戻す。 性能評価 === 性能評価では、Kimi K3は総合的にClaude Fable 5とGPT-5.6 Solの直下に位置し、技術報告で比較された多くのオープンモデルおよびプロプライエタリモデルを上回っている。 特に、コーディング、検索、調査、長期ツール利用を必要とする課題で強い。 一方、Humanity’s Last ExamやCritPtのような研究レベルの推論、OSWorld 2.0のような難しいcomputer use、長期的な行動規律や複雑な協調では、最上位モデルとの差が残っている。 なお、技術報告では、以下の情報は公開されていない。 総事前学習トークン数、最終的なデータ配分、総学習FLOPs、使用GPU数、学習期間、実測MFU、各context lengthでの学習トークン数である。 コメント === Kimi K3は、現時点で最も強力なオープンウェイトモデルの一つであり、そのアーキテクチャ、学習方法、システム実装をまとめた重要な資料である。 新技術があるというよりも、必要な技術を幅広く取り込み、それぞれを大規模モデルで実際に動作するまで作り込んでいるという印象が強い。 モデル開発をしている立場から、特に印象的だった点は次の二つである。 ・Kimi K2に引き続き、��後学習におけるエージェントRL環境へ非常に大きな投資をしている。テキスト、画像、コード、Web、業務アプリケーション、GPU kernelなどを含む多様なエージェント課題を合成し、長期間にわたるtool useと試行錯���を学習させている。この部分については、改めて詳しく紹介したい。 ・十分なablation studyが提供されていないため、それぞれの技術選択が、どのような比較や判断に基づいて行われたのかは分からない部分が多い。KDA、Attention Residuals、Stable LatentMoE、SiTU-GLU、Quantile Balancing、Per-Head Muonなどの個別技術が、最終性能や学習効率改善にどの程度寄与したのかは分解されていない。 実際には、内部実験の結果、学習安定性、GPUカーネルの効率、分散学習時の通信、メモリ制約など、さまざまな要因を総合して選択したと考えられる。
See More
zaoriku0
retweeted
iwashi / Yoshimasa Iwase
@iwashi86
7 days ago
量がすごい。あとで読もう。 https://t.co/N4eRD5ojzQ
zaoriku0
retweeted
今井翔太 / Shota Imai@えるエル
@ImAI_Eruel
7 days ago
Fable/Mythos5では推論中に人の言語とも思えぬ意味不明な思考過程を出力することが報告されてましたが、Claude Opus5では推論の過程���「うおおおおおおおお」「NOO0!!」みたいな発狂ワードが出る模様 DeepSeek R1の論文でも、突然LLMの出力挙動が不自然になる(でも性能は上がる)「Ahaモーメント」が報告されてましたが、ある意味で、極限まで考えると発狂する人間の性質を受け継いでいるのか、言語的にも発狂ワードを入れた方が飛躍的な発想につながるのか、はたまた整理されてロジックが通った自然言語は邪魔になるのか
ZAORIKU, D.M
@zaoriku0
9 days ago
要望はバッサリ切られたけど、現場の人が読んでくれたかも、機種とっかえられたけどコア数戻って帰ってきた。ゲーミングマシンになったのは笑えるw
ZAORIKU, D.M
@zaoriku0
27 days ago
某社、修理メールの問い合わせが、AIに変わった気配を感じる… なんだかなぁ…不安w
ZAORIKU, D.M
@zaoriku0
9 days ago
ハサウェィ、アメリカだと苦戦してるんだな それをうけてなのか… https://t.co/A4A53Aub2O
zaoriku0
retweeted
MIRO
@MobileHackerz
11 days ago
POPOPOのソーシャル部分の実装はぜんぶflutter側なのと、Unityで画像を扱う部分を高速化したライブラリをオープンソースにしたのでご活用いただければ。メインスレッド非依存です。 https://t.co/A69DPKaO4M
zaoriku0
retweeted
Kazunori Sato
@kazunori_279
13 days ago
Maps Grounding Lite MCP を使用して、現実世界の地理空間コンテキストで AI エージェントをグラウンディングする https://t.co/YK0rnwgpgu
ZAORIKU, D.M
@zaoriku0
13 days ago
ノートン削除/再インストールツール を使わないと外せないのひどくね?
Last Seen Users on Sotwe
Buttermilk
Seen from
Indonesia
بغدادي VVIP
Right Angle News Network
Seen from
Netherlands
♥️♥️ ชอบสาวแก่ แล้วไง♥️♥️
Seen from
Thailand
Tencent Hy
Seen from
Singapore
N
Ming
Seen from
Thailand
🤘🏼19 YAŞINDA AZGIN GENÇ🤘🏼
Seen from
Turkey
hilmiey
Seen from
Malaysia
الزب العراقي
Trends for you
1
#NoValkoNoMoney
Under 10K tweets
2
#HOTD
Under 10K tweets
3
Good Monday
Under 10K tweets
4
#mindfulliving
Under 10K tweets
5
Lyric
Under 10K tweets
6
Sheepstealer
Under 10K tweets
7
AUTUMN LEAVES
Under 10K tweets
8
Seth
Under 10K tweets
9
Rhaenyra
Under 10K tweets
10
Mario Lopez
Under 10K tweets
Most Popular Users
1
Elon Musk
@elonmusk
241.1M followers
2
Barack Obama
@barackobama
119.1M followers
3
Cristiano Ronaldo
@cristiano
112.5M followers
4
Donald J. Trump
@realdonaldtrump
111.8M followers
5
Narendra Modi
@narendramodi
107.1M followers
6
Rihanna
@rihanna
98.2M followers
7
NASA
@nasa
92.2M followers
8
Justin Bieber
@justinbieber
91.4M followers
9
KATY PERRY
@katyperry
88.8M followers
10
Taylor Swift
@taylorswift13
82.7M followers
11
Lady Gaga
@ladygaga
74.2M followers
12
Virat Kohli
@imvkohli
71.6M followers
13
Kim Kardashian
@kimkardashian
70.3M followers
14
YouTube
@youtube
68.7M followers
15
Neymar Jr
@neymarjr
64.5M followers
16
Bill Gates
@billgates
64.5M followers
17
The Ellen Show
@theellenshow
62.4M followers
18
Selena Gomez
@selenagomez
61.9M followers
19
CNN
@cnn
61.8M followers
20
X
@x
60.8M followers
Olivia
Online
✨
⭐
💫