Qiita (LLM)Japan
LLM評価のプロンプトはどう書くか、LLM-as-a-judgeの判定がブレる原因と3つの対処

LLMの出力を別のLLMに評価させる、いわゆるLLM-as-a-judgeを評価の仕組みに組み込んでいる。評価を自動化する記事では全体の構成を書いたが、実際にやってみると判定プロンプトの書き方で結果が大きく変わる。今回はそこに絞って書く。 自分の運用では、判定基準の曖昧さを...
Read at Qiita (LLM) ↗More from Qiita (LLM) on Accept All

Japan破面解析AIの中身を整理 豊田自動織機、電子顕微鏡の自動操作と熟練技術者10年分の画像で1件2時間程度に Qiita (LLM)

Japan無検閲ローカルLLMを試してみた dolphin-mistral:7b Qiita (LLM)

JapanLLMに渡すデータのトークン:整形JSONはCSVの3倍、列指向JSONはCSVと同じだった Qiita (LLM)

Japan【Cursor pstack】AIエージェントに開発を任せる環境をつくる ―月2,500件のPRを支えた開発基盤とは? Zenn (AI)

Japan0.8Bのゼロショット分類モデル「Jeff」でキーワードルールベース分類を殴ってみた Zenn (AI)
