Dado el sesgo en los datos con x, lo primero obvio es usar una regresión logística ( enlace wiki ). Así que estoy con whuber en esto. Voy a decir esoxpor sí solo mostrará una gran importancia pero no explicará la mayor parte de la desviación (el equivalente de la suma total de cuadrados en un MCO). Entonces uno podría sugerir que hay otra covariable aparte dex que ayuda al poder explicativo (por ejemplo, las personas que hacen la clasificación o el método utilizado), su ysin embargo, los datos ya son [0,1]: ¿sabe si representan probabilidades o relaciones de ocurrencia? Si es así, debe intentar una regresión logística utilizando su no transformadoy (antes de que sean razones / probabilidades).
La observación de Peter Flom solo tiene sentido si su y no es una probabilidad. Consultar plot(density(y));rug(y)en diferentes cubos dexy vea si ve una distribución Beta cambiante o simplemente se ejecuta betareg. Tenga en cuenta que la distribución beta también es una distribución familiar exponencial y, por lo tanto, debería ser posible modelarla glmen R.
Para darle una idea de lo que quise decir con regresión logística:
# the 'real' relationship where y is interpreted as the probability of success
y = runif(400)
x = -2*(log(y/(1-y)) - 2) + rnorm(400,sd=2)
glm.logit=glm(y~x,family=binomial); summary(glm.logit)
plot(y ~ x); require(faraway); grid()
points(x,ilogit(coef(glm.logit) %*% rbind(1.0,x)),col="red")
tt=runif(400) # an example of your untransformed regression
newy = ifelse(tt < y, 1, 0)
glm.logit=glm(newy~x,family=binomial); summary(glm.logit)
# if there is not a good match in your tail probabilities try different link function or oversampling with correction (will be worse here, but perhaps not in your data)
glm.probit=glm(y~x,family=binomial(link=probit)); summary(glm.probit)
glm.cloglog=glm(y~x,family=binomial(link=cloglog)); summary(glm.cloglog)

EDITAR: después de leer los comentarios:
Dado que "los valores de y son probabilidades de pertenecer a una clase determinada, obtenida del promedio de las clasificaciones hechas manualmente por personas", recomiendo hacer una regresión logística en sus datos base. Aquí hay un ejemplo:
Suponga que está viendo la probabilidad de que alguien acepte una propuesta (y=1 de acuerdo, y=0 en desacuerdo) dado un incentivo xentre 0 y 10 (podría transformarse logarítmicamente, por ejemplo, remuneración). Hay dos personas que proponen la oferta a los candidatos ("Jill y Jack"). El modelo real es que los candidatos tienen una tasa de aceptación base y eso aumenta a medida que aumenta el incentivo. Pero también depende de quién está proponiendo la oferta (en este caso, decimos que Jill tiene una mejor oportunidad que Jack). Suponga que combinados solicitan 1000 candidatos y recopilan sus datos de aceptación (1) o rechazo (0).
require(faraway)
people = c("Jill","Jack")
proposer = sample(people,1000,replace=T)
incentive = runif(1000, min = 0, max =10)
noise = rnorm(1000,sd=2)
# base probability of agreeing is about 12% (ilogit(-2))
agrees = ilogit(-2 + 1*incentive + ifelse(proposer == "Jill", 0 , -0.75) + noise)
tt = runif(1000)
observedAgrees = ifelse(tt < agrees,1,0)
glm.logit=glm(observedAgrees~incentive+proposer,family=binomial); summary(glm.logit)
En el resumen, puede ver que el modelo se ajusta bastante bien. La desviación esχ2n−3 (estándar de χ2 es 2.df−−−−√) Que encaja y supera a un modelo con una probabilidad fija (la diferencia en desviaciones es de varios cientos conχ22) Es un poco más difícil de dibujar dado que hay dos covariables aquí, pero se entiende la idea.
xs = coef(glm.logit) %*% rbind(1,incentive,as.factor(proposer))
ys = as.vector(unlist(ilogit(xs)))
plot(ys~ incentive, type="n"); require(faraway); grid()
points(incentive[proposer == "Jill"],ys[proposer == "Jill"],col="red")
points(incentive[proposer == "Jack"],ys[proposer == "Jack"],col="blue")

Como puede ver, a Jill le resulta más fácil obtener una buena tasa de éxito que Jack, pero eso desaparece a medida que aumenta el incentivo.
Básicamente, debe aplicar este tipo de modelo a sus datos originales. Si su salida es binaria, mantenga el 1/0 si es multinomial, necesita una regresión logística multinomial. Si cree que la fuente adicional de variación no es el recopilador de datos, agregue otro factor (o variable continua), lo que considere que tiene sentido para sus datos. Los datos vienen primero, segundo y tercero, solo entonces entra en juego el modelo.