@gaulix_refrac@anatolium Ces modèles sont des systèmes black-box, personne ne peut exactement savoir comment ils fonctionnent, et ça sera encore + vrai dans le futur. Les benchmarks sont des tests sur des aspects précis, et ensuite c’est de l’interpolation. Il y a des angles morts
@gaulix_refrac@anatolium Hmm tu ferais confiance à une boite US opaque du type https://t.co/MEdPCLd9gY pour comprendre et modifier certains aspects d���un modèle chinois ? Donc la y’a 2 boîtes étrangères qui ont tripoté ton modèle avant utilisation
@anatolium Qui dit que les modèles Qwen n’ont pas, parmi leurs milliards de paramètres, des backdoors qui pourraient être activées au moment voulu, ou même des légers biais qui changent ta perception du monde en leur faveur petit à petit
@arcprize@AnthropicAI You could create a benchmark with the few hard challenges from ARC-AGI-2 ? Seems like even the best models are stuck at 90% currently
@GuillaumeRozier Sympa… mais je suis un peu tiraillé par le fait que chaque médaille est tellement unique… les additionner et garder le décompte global c’est un peu effacer les peines, les efforts et les joies derrière chacune d’elles
@fchollet That’s also what I think. Unfortunately ARC-2 problems are more and more complex, not sure whether that incentivises solutions to converge towards an elegant AGI solution.