Langfuse
Plateforme open-source d’observabilité, d’analytique et d’évaluation pour applications et agents basés sur des LLM.
Framework open-source pour évaluer, tester et fiabiliser des applications LLM, agents et pipelines RAG.
DeepEval apporte une approche structurée et mesurable à l’évaluation des systèmes LLM. Sa force est la standardisation des métriques et la facilité d’intégration dans des workflows existants. Il est particulièrement utile pour éviter des régressions silencieuses. En contrepartie, la pertinence des résultats dépend de la qualité des scénarios de test et du choix des métriques.
Plateforme open-source d’observabilité, d’analytique et d’évaluation pour applications et agents basés sur des LLM.
Framework open-source pour programmer, optimiser et évaluer des systèmes LLM sans dépendre du prompt engineering manuel.
Framework open-source permettant de tester, comparer et évaluer prompts, modèles et pipelines LLM.
NeuraForge AI est une plateforme d’automatisation intelligente conçue pour créer des workflows IA avancés, coordonner des agents autonome…
Outil IA orienté fine-tuning accéléré de LLM, visant à réduire le temps d’entraînement et l’usage mémoire pour des modèles open-source.
Outil open-source no-code pour concevoir visuellement des workflows LLM et applications basées sur LangChain.
Un seul hub pour comprendre où se place DeepEval : outils proches, comparaisons, catégorie, intentions de recherche et relations sémantiques.