
Farklı sözcükler anlaşmazlık değildir
Yan yana model karşılaştırması size sonuçsuz uzun bir metin bloğu verir. Farkların çoğu yalnızca sözcüktür. Önemli birkaç fark o gürültünün içinde gizlenir: bir model farklı bir sayı verir, biri diğerinin yapmadığı bir öneride bulunur ya da biri diğerinin atladığı bir uyarıyı ekler.
Bunları ayırmak için yalnızca farklara değil anlama bakarak okumanız gerekir. İki yanıt neredeyse hiç ortak sözcük paylaşmadan aynı şeyi kastedebilir. İki başkası neredeyse özdeş olup sonucu belirleyen tek yan cümlede ayrışabilir.
Bir bulgu daha yalnızca dikkatli okuyunca çıkar. Bazen sapma model kalitesiyle ilgili değildir. Prompt'un belirsiz olduğu ve her modelin onu farklı yorumladığı anlamına gelir. Bu çoğu zaman karşılaştırmanın en işe yarar sonucudur ve bir diff aracı bunu tespit edemez.
Agent Studio'da bu agent nasıl kurulur
System prompt sizin kullanım alanınız için maddi bir farkı tanımlar. Agent'a prompt belirsizliğini model kalitesi olarak değil kendi kategorisi olarak ele almasını da söyler.
Koyduğunuz değerlendirme ölçütleri, alanınızda neyin iyi yanıt sayıldığını ve sizin için en çok önem taşıyan başarısızlık biçimlerini belirler.
ActionFlows 83 model sağlayıcısına bağlı olduğu için karşılaştırma setini seçmek bir entegrasyon projesi değil yapılandırmadır. Bir sağlayıcı Credentials altında bağlandıktan sonra modelleri herhangi bir node'a ve herhangi bir agent'a açık olur.
Akış, prompt'ları gönderdiğinde en iyi çalışır. Bu kurulumda bir ActionFlow aynı prompt'u, her biri farklı bir service'e bağlı birkaç Generate Text node'una gönderir ve çıktıları Agent Chat node'u üzerinden agent'a iletir. Yargıyı agent yürütür. Her AI node kendi token kullanımını ve maliyetini çıktısında raporlar; böylece ekstra enstrümantasyon olmadan aynı çalıştırmada hem kalite yargısı hem fiyat karşılaştırması alırsınız.
Ham çıktıları saklayın; çünkü hükme eninde sonunda katılmayacaksınız. Bunu çözmenin tek yolu kaynakları yeniden okumaktır.
Bu agent nelerden oluşur
- System prompt: neyin maddi sayıldığı ve prompt belirsizliğini ayrı işaretleme talimatı.
- Prompt skills: değerlendirme ölçütleriniz ve önemsediğiniz başarısızlık biçimleri.
- Generate Text (AI Core): bir akışta birkaç node, her biri farklı bir model service'inde.
- Agent Chat (Util): toplanan çıktıları yargı için agent'a teslim eder.
- Node cost outputs: kalite hükmü ve fiyat karşılaştırması aynı çalıştırmada üretilir.
- Google Sheets (Integration): hükümleri kaydeder; modeller değiştikçe karşılaştırmalar yinelenebilir.
- ActionFlow yeterli olduğunda: Rutin maliyet ve gecikme kıyaslaması çalıştırıyorsanız, bir puanlama adımı olan iş akışı kurun. Soru kaliteyse agent'ı kullanın.
Sık sorulan sorular
Bülten
Ürün güncellemelerini alın
Yeni node'lar, agent'lar ve ürün notları. Yalnızca açmaya değer bir şey varken e-posta göndeririz.