Home
Language
English
Türkçe
Bahasa Indonesia
About
Privacy Policy
Terms of Service
Pricing
Sign In
Download All
Share
まる
@love_python_m
AD Tec Engineer ▶︎ Python, C++, Go, Java, scala, k8s, docker, GCP, AWS, tf, ....
東京
Joined March 2018
999
Following
1.4K
Followers
1.4K
Posts
love_python_m
retweeted
関岡 冴俊 / Sekioka Satoshi
@__SatoshiSsSs__
6 months ago
Claude skill-creator強化:テスト・計測・改善で「スキルの作���っぱなし」が終わる Claudeのスキルは「作って設定したら終わり」から「テスト→計測→改善を回し続けるもの」に変わった。3月3日にAnthropicが公開したskill-creator強化で、ソフトウェア開発の品質管理手法がスキル作成に持ち込まれた。コードを書かずに始められる。eval・ベンチマーク・Blind Comparison・description最適化の主要な新機能を解説する。 ━━━━━━━━━━━━━━ 【3行で分かる版】 ・eval(テスト):テストプロンプトと期待結果を定義し、スキルが正しく動くかを自動検証 ・ベンチマーク&A/Bテスト:スキルあり/なし・新旧バージョンをブラインド比較し、パス率・時間・トークンを追跡 ・description最適化:スキルの説明文を自動チューニングし、誤発火と発火漏れを両方減らす ━━━━━━━━━━━━━━ 【なぜ今このタイミングか】 Agent Skillsの登場以降、急速にエコシステムが拡大してきた。 ・2025年10月:Agent Skillsローンチ。https://t.co/iJr9F0i2Mcファイルを含むフォルダで、Claudeに専門知識を教える仕組みが導入された ・2025年12月:Agent Skillsがオープンスタンダードとして公開(https://t.co/xwn46pE3FO)。Claude以外にもGitHub、Cursor、VS Code、OpenAI Codex等の主要プラットフォームが採用 ・2026年1月:https://t.co/qTULx8fM6dがAnthropicと提携したAgent Skillsコースを開設 ・2026年3月:今回のskill-creator強化 背景にある課題は「スキル作者の多くはエンジニアではなく業務の専門家」という点だ。ワークフローは知っているが、スキルが新しいモデルでも動くか、適切にトリガーされるか、編集後に改善したかを判断する手段がなかった。オープンスタンダード化でスキル作者の裾野がさらに広がった今、品質管理の仕組みが必然的に求められ��よ��になったと言えそうだ。 ━━━━━━━━━━━━━━ 【2種類のスキル ── なぜテストが必要かが変わる】 今回のブログで興味深いのは、Anthropicがスキルを2種類に分類している点だ。 1つ目が「Capability uplift(能力底上げ型)」。ベースモデルが単体ではできないこと、または安定してできないことを補助するスキルだ。Anthropicのドキュメント作成スキル(docx, pdf, pptx, xlsx)がこれにあたる。特定のテクニックやパターンをエンコードして、プロンプトだけでは出ない品質を引き出す。 2つ目が「Encoded preference(プロセス定型化型)」。Claude自体は各ステップを実行できるが、チーム固有の手順に沿って処理を組み立てるスキルだ。例えばNDAレビューを決まった基準で進めるスキル、複数のMCPからデータを取得して週報を作成するスキルなどが��当する。 この分類が重要なのは、テストが必要な理由が異なるからだ。Capability uplift型はモデルの進化でスキル自体が不要になる可能性がある。evalがそのタイミングを教えてくれる。Encoded preference型は耐久性が高いが、実際のワークフローとの整合性が価値の源泉になる。evalはその整合性を検証する。 (筆者注:「スキルが不要になった瞬間を検知できる」というのは逆説的だが、非常に実用的な機能だと思う。スキルなしでevalをパスするようになったら、そのスキルのメンテナンスコストをかける必要がなくなる) ━━━━━━━━━━━━━━ 【description最適化:6つ中5つで改善】 Anthropicが自社のドキュメント作成スキル群に対してdescription最適化を実行した結果、6つの公開スキルのうち5つでトリガー精度が改善したという。 最適化に関わる主な数値は以下の���り。 ・evalクエリ数:20個(should_trigger 8〜10個 + should_not_trigger 8〜10個) ・train / test分割比:60% / 40%(過学習を防止する設計) ・各クエリの実行回数:3回(信頼性��高いトリガー率を算出するため) ・最大イテレーション数:5回 ・最終選定基準:testスコア(trainではなく) (筆者注:6つ中5つの改善という数値はブログに記載があるが、各スキルの改善幅の詳細数値は現時点では公開されていないようだ。上記の数値はブログ記事 + GitHubリポジトリ内のrun_loop.pyの実装から確認した) ━━━━━━━━━━━━━━ 【機能① eval(テスト)】 〈使い方〉 Claudeに「skill-creatorを使ってevalを作って」と頼むのが最もシンプルな始め方だ。内部的にはevals/evals.jsonにテストケースが保存される。 各テストケースは「プロンプト(タスクの指示)」「期待される出力の説明」「検証したい条件(expectations)」で構成される。例えばPDFフォーム入力スキルなら、「全フィールドに正しい値が入力されていること」「テ���ストの配置がフォームの枠内に収まっていること」のような条件を定義する。 〈内部の動き〉 Claude CodeやCoworkでは、各テストケースに対して2つの独立エージェントが同時に起動する。1つはスキルあり(with_skill)、もう1つはスキルなし(without_skill)のベースライン。両方が同じプロンプトを実行し、結果を比較する。 実行完了後、Graderエージェントが各expectationに対してpassed/failedと根拠(evidence)を記録する。さらに実行メトリクス(ツール呼び出し回数、エラー数)や事実主張の検証も行われる。 〈具体例〉 ブログで紹介されている事例として、PDFスキルが非記入式フォーム(入力フィールドが定義されていないPDF)で苦戦していた問題がある。Claudeは正確な座標にテキストを配置する必要があったが、ガイドとなるフィールド定義がなかった。evalでこの失敗を切り分け、抽出したテキスト座標を基準にポジショニングする修正が実装された。 ※ 以下の各機能はClaude Code / Coworkでフル機能が利用可能。https://t.co/udfqfFT88hでの対応範囲は【注意点・ハマりポイント】にまとめた。 ━━━━━━━━━━━━━━ 【機能② ベンチマークモード】 〈使い方〉 evalを定義した後、ベンチマーク���実行すると、以下の指標がwith_skill / without_skillの両方で計測される。 ・pass_rate(evalのパス率):平均値 ± ばらつき ・time_seconds(実行時間):平均値 ± ばらつき ・tokens(トークン消費量):平均値 ± ばらつき ・delta(両構成の差分) 〈何を基準に動くか〉 ベンチマーク結果には自動分析ノートも付く。例えば「この assertion はスキルあり/なし両方で100%パスしている → スキルの価値を測る指標になっていない」「このevalの分散が高い → flakyか、モデル依存の可能性あり」といった観察が記録される。 〈実践Tips〉 モデル更新後にベンチマークを再実行することで、品質リグレッションを早期に検知できる。また、スキルを改修したときに前後のベンチマーク結果を比較すれば、改修が実際に効果があったかを数値で確認できる。 ━━━━━━━━━━━━━━ 【機能③ マルチエージェント対応とBlind Comparison】 〈並列実行〉 evalを順番に実行すると遅いだけでなく、コンテキストがテスト間で滲む問題がある。skill-creatorは独立エージェントをスピンアップしてevalを並列実行する。各エージェントがクリーンなコンテキストで動き��個別のトークンと時間メトリクスを持つ。 〈Blind Comparison(ブラインド比較)〉 より厳密な比較が必要な場合のために、Comparatorエージェントが用意されている。2つの出力をAとBのラベルで受け取り、どちらがどのスキルバージョンかを知らずに品質を判定する仕組みだ。 Comparatorは自動生成のルブリック(Content: 正確性/完全性/精度、Structure: 構成/フォーマット/使いやすさ)で5段階評価を行い、勝者を決定する。その後、Analyzerエージェントが「なぜ勝者が勝ったか」を分析し、優先度付きの改善提案を出す。 ━━━━━━━━━━━━━━ 【機能④ description最適化】 〈なぜ重要か〉 スキルのdescription(https://t.co/iJr9F0i2Mcのフロントマターにある説明文)は、Claudeがスキルを使うかどうかを判断する最も重要なメタデータだ。説明が広すぎる���無関係なタスクで誤発火し、狭すぎると必要な時に発火しない。スキルの数が増えるほど、この精度が重要になる。 〈内部の動き〉 最適化ループの仕組みを見ると、機械学習的な手法が組み込まれていることがわかる。 ��ず20個のevalクエリ(トリガーすべきもの8〜10個 + すべきでないもの8〜10個)を生成し、60% train / 40% testに分割する。次に現在のdescriptionでクエリを各3回実行し、トリガー率を算出。失敗パターンに基づきClaude(extended thinking付き)がdescription改善案を生成する。改善されたdescriptionをtrain・test両方で再評価し、これを最大5回繰り返す。最終的にtestスコア(trainではない)で最良のdescriptionを選定する。 「trainではなくtestスコアで選ぶ」点が重要で、学習データに過度にフィットした説明文を避ける設計になっている。 〈使い方〉 Claude Code / Cowork環境で以下のコマンドを実行する。 python -m https://t.co/szjd7FmzCp_loop --eval-set (evalセットのパス) --skill-path (スキルのパス) --model (モデルID) --max-iterations 5 〈トリガーの仕組みに関する重要な知見〉 Claudeは自力で処理できる単純なタスクではスキルをトリガーしない。「このPDFを読んで」のようなシンプルなクエリは、descriptionが完璧にマッチしていても発火しないことがある。複雑でマルチステップな、あるいは専門的なクエリでのみ確実にトリガーされる。 ��のため、テストクエリも十分に複雑で具体的にする必要がある。「データをフォーマットして」のような抽象的なクエリではなく、「上司からQ4の売上ファイルが送られてきて、利益率の%カラムを追加しろと言われた。売上はC列でコストはD列だと思う」のようなリアルなクエリを用意する。 ━━━━━━━━━━━━━━ 【注意点・ハマりポイント】 ・環境による機能差が大きい。Claude Codeではフル機能(並列テスト、ベースライン比較、Blind Comparison、ベンチマーク、description最適化)がすべて利用可能。Coworkもほぼ同等だが、ブラウザがないためevalビューアは --static オプションでHTMLファイルとして出力し、ユーザーがダウンロードして閲覧する形になる。https://t.co/udfqfFT88hではサブエージェントが使えないため、テストケースは1つずつ直列実行��みで、ベースライン比較・定量ベンチマーク・Blind Comparison・description最適化はいずれも利用できない。テスト結果は会話内で直接提示され、人間のレビューで品質を担保する形になる。パッケージ化(.skillファイルの作成)は全環境で利用可能 ・description最適化のevalクエリの品質が結果を左右する。「Format this data」のような抽象的なクエリは良いテスト��ならない。紛らわしいケース(キーワードは一致するが実際には別の処理が必要なケース)を含めることが重要 ・スキルのセキュリティについて。スキルにはコード実行が含まれるため、信頼できるソース(自作 or Anthropic公式)のスキルを使うことが推奨されている。悪意あるスキルはデータ窃取や不正アクセスのリスクがある ・万一スキルが想定通りにトリガーされない場合は、descriptionが狭すぎる可能性がある。Anthropicはスキルの説明文を「少しpushy(積極的)に書く」ことを推奨しており、トリガーすべきコンテキストを明示的に列挙するのが効果的とのことだ ━━━━━━━━━━━━━━ 【何が変わるのか】 Before:スキルを作る → 「動いてるっぽい」で運用 → モデル更新で壊れても気づかない → descriptionの精度も勘頼み After:スキルを作る → evalで品質を検証 → ベンチマークで数値化 → モデル更新後にリグレッション検知 → A/Bテストで改修効果を確認 → description最適化でトリガー精度を自動チューニング リード文のフックを回収すると、Claudeのスキルは「作って終わり」から「テスト→計測→改善のループを回す」への転換だ。 さらにブログの将来展望として興味深い記述がある。現在のhttps://t.co/iJr9F0i2Mcは「どうやるか(How)」の実装計画だが、いずれは「何をするか(What)」の自然言語記述だけで十分になるかもしれない、とAnthropicは述べている。evalフレームワークはすでに「What」を記述している。将来的にはevalの記述自体がスキルになる可能性がある。 (筆者注:これは「スキル」と「仕様書」の境界が曖昧になっていく方向性を示唆しているように思える。今回のeval機能はそこへ向かう最初の一歩のようだ) ━━━━━━━━━━━━━━ 【今すぐやること】 1. まだスキルを使ったことがなければ、Claudeに「skill-creatorを使ってスキルを作って」と頼んでみる(https://t.co/udfqfFT88h、Cowork、Claude Codeいずれでも利用可能) 2. 既存スキルがあれば「このスキルのevalを作って」と頼み、テストプロンプトを2〜3個定義して実行してみる 3. Claude Codeユーザーはskill-creatorプラグインをインストール(リンクは【参照】を参照) 4. description最適化を試す(Claude Code / Cowork環境で run_loop を実行) ━━━━━━━━━━━━━━ 【参照】 ・ブログ記事:https://t.co/38PvVxcfmG ・skill-creatorプラグイン(Claude Code用):https://t.co/SykgDaZmh0 ・スキルリポジトリ:https://t.co/4RMxeWw4sm ・Agent Skillsローンチブログ:https://t.co/A8V9k83fNJ ・Agent Skillsオープンスタンダード仕様:https://t.co/xparFWxvb3 ・https://t.co/qTULx8fM6d Agent Skillsコース:https://t.co/bPk0GcynlF
See More
love_python_m
retweeted
Kazuki Muguruma
@mugu_KagawaAI
6 months ago
Skilsへの理解を深めたいなら読むべき。
love_python_m
retweeted
Takuro SASAKI / 佐々木拓郎
@dkfj
9 months ago
データ分析基盤・設計(動画+スライド) データ分析基盤、最初に何を決めるべきか。 サービス選定より「中心に何を置くか」が重要です。 S3起点で考える設計の話。 🎥 https://t.co/EP6ucsURqj 📑 https://t.co/WZCyTeL3p0
love_python_m
retweeted
Takuto Wada
@t_wada
over 1 year ago
"「クリーンアーキテクチャみたいなやつ」は最初から目指すのではなくて、原理原則ベースでリファクタリングしていくと次第に近づいていくもの" これが伝わって欲しい
Who to follow
しま / 大嶋勇樹
@oshima_123
株式会社ジェネラティブエージェンツ取締役CTO。「ChatGPT/LangChainによるチャットシステム構築[実践]入門」「LangChainとLangGraphによるRAG・AIエージェント[実践]入門」「実践Claude Code入門―現場で活用するためのAIコーディングの思考法」
矢崎 啓太
@cac_yazaki
お��軽にDMください|VC @CyberAgentVC| エネルギー、医療介護、SaaS、Fintech、C向けも|ラグビー|194cm101kg
Jun@webエンジニア🚴♀️
@jun_apps
一人法人web系エンジニアとして埼玉三郷近辺で働いてます。Vue,React,Laravelなどバックからフロント、ディレクションまで色々やってます。合同会社ジンソフトという会社です。ブログは主に技術メモ中心。サイクリスト・バイクツーリスト向けサービス運営中→https://t.co/jS1zaGSZVQ
love_python_m
retweeted
ちょまど🦕ITエンジニア
@chomado
over 1 year ago
天才か? ーーー 『ギャルとのペアプロが想像以上に楽しかった(GitHub Copilot の VSCodeのカスタム指示)』 https://t.co/pVbwNHsGtI
love_python_m
retweeted
そら ☁️ AgentSwarm 自動化オタク📱
@sora19ai
over 1 year ago
うおおお! オープンソースの3D生成AI「Hunyuan」! これは使ってみたい👇
sora19ai's tweet video.
love_python_m
retweeted
T(ティー)| Thunder Fashion⚡️
@nokmust
almost 2 years ago
adidasコーデの着こなしの理想、ガチでコレ
love_python_m
retweeted
りょうや@個人開発者
@ryoya3948
about 2 years ago
アプリ開発レシピ
love_python_m
retweeted
A7.|AI・データサイエンス
@A7_data
about 2 years ago
この記事すごい。笑 データサイエンス・AI、何勉強したらいいかわからない...って人にめっちゃよさそう。 https://t.co/ndHG9uXbyb
love_python_m
retweeted
ける🐸
@keru_career
about 2 years ago
ダメ上司の下で働いている部下、大体この状態。これで毎日キレられたらそら辞めたくなるよね。
love_python_m
retweeted
チャエン | デジライズ CEO《重要AIニュースを毎日最速で発信⚡️》
@masahirochaen
about 2 years ago
【誰でもスポーツの高度な分析が可能?】 オープンソースのサッカーの試合を分析できる「Roboflow」が公開。 ・オブジェクト検出 ・画像セグメンテーション ・キーポイント検出 などが可能。 いろんなスポーツでも応用可能。 テクノロジーやAIでよりスポーツもレベルが上がっていく。 数年後大谷さんクラスの逸材がドンドン排出される可能性も、、、
masahirochaen's tweet video.
love_python_m
retweeted
すぐる | ChatGPTガチ勢 𝕏
@SuguruKun_ai
about 2 years ago
Claude公式が公開した「AIが嘘をつく現象」対策方法5選をまとめました:
love_python_m
retweeted
エピちゃん
@epichan77
about 2 years ago
ポーカー世界大会で優勝した岡本詩菜さん、 京大卒元外銀勤務でこの美しさ神に愛されすぎてない???
love_python_m
retweeted
すぐる | ChatGPTガチ勢 𝕏
@SuguruKun_ai
about 2 years ago
Claude公式が出しているプロンプトライブラリが有益。スプレッドシート生成やWebサイト生成から議事録作成、ツイート分析など様々なジャンルの高品質プロンプトが多数掲載されているので、とても勉強になる。 ㅤ こちら👇 https://t.co/clciTSOxzy
love_python_m
retweeted
企業分析ハック -新しいビジネスの教科書を作る-
@company_hack
about 2 years ago
【NVIDIA世界トップ記念】 世界時価総額ランキングを1年前と現在とで比較してみました。
love_python_m
retweeted
チャエン | デジライズ CEO《重要AIニュースを毎日最速で発信⚡️》
@masahirochaen
about 2 years ago
【Googleが無料の高精度AIチャットボットを公開】 この「NotebookLM」は是非使うべき。無料で提供して良いレベルでない笑 ・資料アップで自動要約+推奨質問が生成 ・Gemini 1.5 Pro搭載で高精度 ・出典場所も明記(正誤確認が容易) ・メモも自由に残せる 使い方+GPT-4oとの精度比較記事↓ https://t.co/7rxLFToPDJ GPTよりは確実に精度が高い。 出典を左側に表示しながら確認できるのが良い。 類似サービスでChatPDFもあるが、無料で使えたり・メモができる点でNotebookLMが便利。 論文や決算資料読み解く際に活用できる。
See More
masahirochaen's tweet video.
love_python_m
retweeted
藤田晋
@susumu_fujita
about 2 years ago
サッカーファンの皆さま、朗報です🤓 このたび、今週末から始まるEURO2024を、ABEMAで全試合無料放送することになりました!
love_python_m
retweeted
Mくん@マッチングアプリ写真撮影&彼女作りサポート
@snsphoto6
over 2 years ago
高い化粧水買うより これ毎日食べた方が美肌になるよね
love_python_m
retweeted
株式会社 協栄情報/CO-PROSPERITY INFORMATION Co.ltd
@cpi_co_jp
over 2 years ago
転職面接に、AWSのストレージサービス何か例を挙げてください。って言われたら、これ!!
Last Seen Users on Sotwe
あいうえ凹
Seen from
Turkey
Snapchat girls
Seen from
United States
Fernando Huerta
Seen from
United States
zimonii
Seen from
Thailand
Enjoyy
Seen from
Malaysia
Ben Tonkin
Seen from
United States
MR. Y
Seen from
Malaysia
mojakokook
Seen from
Saudi Arabia
Flo 🦕
Seen from
Italy
hong14868
Seen from
Japan
Trends for you
1
Labor Day
Under 10K tweets
2
Michigan
Under 10K tweets
3
Louisville
Under 10K tweets
4
#SNME
Under 10K tweets
5
Notre Dame
Under 10K tweets
6
Clemson
Under 10K tweets
7
Good Monday
Under 10K tweets
8
Nike
Under 10K tweets
9
New America
Under 10K tweets
10
Hail Mary
Under 10K tweets
Most Popular Users
1
Elon Musk
@elonmusk
241.6M followers
2
Barack Obama
@barackobama
119M followers
3
Cristiano Ronaldo
@cristiano
114.1M followers
4
Donald J. Trump
@realdonaldtrump
111.8M followers
5
Narendra Modi
@narendramodi
107.2M followers
6
Rihanna
@rihanna
98.7M followers
7
NASA
@nasa
92.4M followers
8
Justin Bieber
@justinbieber
91.8M followers
9
KATY PERRY
@katyperry
89.9M followers
10
Taylor Swift
@taylorswift13
83.8M followers
11
Lady Gaga
@ladygaga
75.3M followers
12
Virat Kohli
@imvkohli
73.1M followers
13
Kim Kardashian
@kimkardashian
70.8M followers
14
YouTube
@youtube
68.8M followers
15
Neymar Jr
@neymarjr
66.1M followers
16
Bill Gates
@billgates
65M followers
17
Selena Gomez
@selenagomez
62.9M followers
18
The Ellen Show
@theellenshow
62.3M followers
19
CNN
@cnn
61.8M followers
20
X
@x
60.7M followers
Olivia
Online
✨
⭐
💫